[논문 리뷰] MASK: A flexible framework to facilitate de-identification of clinical texts
MASK는 사용자 정의 가능한 명명된 엔터티 인식(NER) 및 마스킹 전략을 조합하여 임상 텍스트의 익명화를 위한 유연하고 오픈소스인 파이썬 프레임워크이다. BiLSTM에 ELMo를 적용한 모델과 CRF 기반 방법 등 최신 기술을 지원하며, i2b2 2014 데이터셋에서 이름에 대해 F1 점수 0.98, 전체적으로는 0.97까지 달성하여 연구 목적의 익명화를 크게 가속화하고 향상시켰다.
Medical health records and clinical summaries contain a vast amount of important information in textual form that can help advancing research on treatments, drugs and public health. However, the majority of these information is not shared because they contain private information about patients, their families, or medical staff treating them. Regulations such as HIPPA in the US, PHIPPA in Canada and GDPR regulate the protection, processing and distribution of this information. In case this information is de-identified and personal information are replaced or redacted, they could be distributed to the research community. In this paper, we present MASK, a software package that is designed to perform the de-identification task. The software is able to perform named entity recognition using some of the state-of-the-art techniques and then mask or redact recognized entities. The user is able to select named entity recognition algorithm (currently implemented are two versions of CRF-based techniques and BiLSTM-based neural network with pre-trained GLoVe and ELMo embedding) and masking algorithm (e.g. shift dates, replace names/locations, totally redact entity).
연구 동기 및 목표
- 임상 텍스트의 익명화 과정에서 연구 활용도를 유지하면서 도전 과제를 해결하기 위해.
- 다양한 NER 및 마스킹 알고리즘을 지원하는 모듈러하고 확장 가능한 프레임워크를 제공하기 위해.
- 50,000건의 레코드에 대해 수십만 달러가 넘는 비용이 들 수 있는 수작업 익명화의 비용과 시간을 줄이기 위해.
- 연구자가 각 엔터티 유형에 맞는 최적의 NER 및 마스킹 방법을 선택할 수 있도록 하여 정확도와 개인정보 보호 준수를 향상시키기 위해.
- 새로운 모델과 데이터 형식을 위한 확장성을 제공하며, 더 큰 연구 시스템 내에서 라이브러리 또는 도구로 통합 가능하도록 지원하기 위해.
제안 방법
- MASK는 플러그인 기반 아키텍처를 사용하여 서로 교환 가능한 명명된 엔터티 인식(NER) 및 마스킹 알고리즘을 지원한다.
- 어휘적 및 사전 기반 특징을 사용하는 두 가지 CRF 기반 NER 모델과, 사전 학습된 ELMo 및 GLoVe 임베딩을 사용하는 두 가지 BiLSTM 기반 모델을 지원한다.
- NER 모델은 i2b2 2014 및 ICES 프리미스 데이터 등 임상 텍스트 데이터셋에서 훈련되거나 미세조정된다.
- 마스킹 전략으로는 엔터티 대체, 날짜 이동, 완전한 제거가 포함되며, 각 엔터티 유형별로 구성 가능하다.
- 훈련 및 추론를 위한 사용자 정의 독자 플러그인을 통해 다양한 입력 형식을 지원한다.
- 먼저 NER를 통해 PHI/PII를 탐지한 후, 사용자가 선택한 마스킹 기법을 적용함으로써 엔드 투 엔드 익명화를 가능하게 한다.
실험 결과
연구 질문
- RQ1모듈러한 프레임워크는 통합된 도구에 비해 임상 텍스트 익명화의 정확도와 효율성을 향상시킬 수 있는가?
- RQ2CRF 기반과 딥러닝 기반의 다양한 NER 모델은 임상 익명화 작업에서 어떻게 성능을 발휘하는가?
- RQ3임상 환경에서 다양한 NER 모델 간의 속도, 정확도, 일반화 능력 간의 상충 관계는 어떠한가?
- RQ4사전 학습된 임베딩의 미세조정은 자원이 적은 임상 엔터티 유형에서 성능 향상에 기여하는가?
- RQ5다양한 연구 및 임상 용도에 적합한 민감도 높은 플러그인 기반 아키텍처는 어느 정도의 유연성을 제공하는가?
주요 결과
- ELMo 임베딩을 사용한 BiLSTM 모델은 i2b2 2014 테스트 세트에서 전체 F1 점수 0.97을 기록하여 가장 높은 성능을 보였다.
- 이름(Entity NAME) 클래스는 F1 점수 0.98을 기록하여 개인 이름에 대해 뛰어난 성능을 보였다.
- 어휘적 및 사전 기반 특징을 사용한 CRF 모델은 많은 이전 시스템을 능가했으며, 딥러닝 모델보다 훨씬 빠른 처리 속도를 보였다.
- GLoVe 임베딩을 사용한 BiLSTM 모델은 비임상적 사전 학습된 임베딩을 사용한 탓에 성능이 떨어졌다.
- ELMo 기반 모델은 다양한 도메인으로의 일반화 능력이 뛰어나며, 적은 양의 미세조정 데이터셋으로도 적응이 가능했다.
- ELMo 모델의 훈련은 CPU에서 1에포크당 약 1시간이 소요되었고, 추론은 각 내역당 최대 10초가 걸렸으며, CRF 모델은 각 내역을 0.5초 이내에 처리했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.