Skip to main content
QUICK REVIEW

[논문 리뷰] A survey of automatic de-identification of longitudinal clinical narratives

Vithya Yogarajan, Michael Mayo|arXiv (Cornell University)|2018. 10. 15.
Machine Learning in Healthcare인용 수 8
한 줄 요약

이 종합 검토는 종단적 임상 기록에 대한 자동 탈식별 시스템의 진화를 분석하며, 규칙 기반 및 CRF 전용 모델에서 하이브리드 및 딥 러닝 접근법으로의 전환을 추적한다. 주요 대회(2014 i2b2 UTHealth, 2016 CEGS N-GRID)에서의 성능을 평가하여 데이터셋 간 적응 능력의 국한된 수준을 강조하고, 보다 단순하고 재현 가능하며 이식 가능한 시스템을 통해 벤치마크 데이터를 초월한 강건성과 일반화 능력을 향상시킬 것을 촉구한다.

ABSTRACT

Use of medical data, also known as electronic health records, in research helps develop and advance medical science. However, protecting patient confidentiality and identity while using medical data for analysis is crucial. Medical data can be in the form of tabular structures (i.e. tables), free-form narratives, and images. This study focuses on medical data in the free form longitudinal text. De-identification of electronic health records provides the opportunity to use such data for research without it affecting patient privacy, and avoids the need for individual patient consent. In recent years there is increasing interest in developing an accurate, robust and adaptable automatic de-identification system for electronic health records. This is mainly due to the dilemma between the availability of an abundance of health data, and the inability to use such data in research due to legal and ethical restrictions. De-identification tracks in competitions such as the 2014 i2b2 UTHealth and the 2016 CEGS N-GRID shared tasks have provided a great platform to advance this area. The primary reasons for this include the open source nature of the dataset and the fact that raw psychiatric data were used for 2016 competitions. This study focuses on noticeable trend changes in the techniques used in the development of automatic de-identification for longitudinal clinical narratives. More specifically, the shift from using conditional random fields (CRF) based systems only or rules (regular expressions, dictionary or combinations) based systems only, to hybrid models (combining CRF and rules), and more recently to deep learning based systems. We review the literature and results that arose from the 2014 and the 2016 competitions and discuss the outcomes of these systems. We also provide a list of research questions that emerged from this survey.

연구 동기 및 목표

  • 종단적 임상 기록에 대한 자동 탈식별 시스템의 기술적 진화를 분석하기 위해.
  • 주요 공동 과제(2014 i2b2 UTHealth 및 2016 CEGS N-GRID 대회)에서의 시스템 성능 및 적응 능력을 평가하기 위해.
  • 다양한 EHR 데이터셋에서의 일반화, 재현 가능성, 희귀 또는 어휘에 없는 PHI 처리에 지속적인 과제를 식별하기 위해.
  • 시스템의 강건성, 이식 가능성, HIPAA 기준 준수를 향상시키기 위한 핵심 연구 질문을 제안하기 위해.

제안 방법

  • 2014 i2b2 UTHealth 및 2016 CEGS N-GRID 공동 과제의 문헌 및 대회 결과에 대한 체계적 검토.
  • 규칙 기반 시스템(정규 표현식, 사전), CRF 모델, 하이브리드 CRF-규칙 시스템, 딥 러닝 모델(LSTM 등)을 포함한 탈식별 기법 분석.
  • 다양한 PHI 카테고리(예: 이름, 날짜, 위치) 및 데이터셋 이동, 특히 2016년 대회 트랙 1A에서의 시스템 성능 평가.
  • 법률 또는 검색 로그와 같은 덜 민감한 도메인의 데이터를 활용한 전이 학습 잠재력 평가로 의료 텍스트에서의 일반화 향상 가능성 검토.
  • 수동으로 작성된 규칙의 엔지니어링과 그 새로운 데이터셋에 적응하는 데서 나타나는 한계 분석.
  • 어휘 임베딩과 의미 모델링이 희귀 PHI 인스턴스를 포착하는 데 미치는 영향 조사.

실험 결과

연구 질문

  • RQ1하이브리드 시스템이 최적의 접근 방식인지, 아니면 LSTMs와 같은 엔드 투 엔드 기계 학습 모델이 데이터셋 간에 더 뛰어난 성능과 일반화 능력을 보일 수 있는가?
  • RQ2PHI 탐지용 규칙 및 정규 표현식을 수동으로 작성하는 대신 데이터에서 자동으로 학습할 수 있는가?
  • RQ3저빈도 학습 빈도 외에, PROFESSION 및 LOCATION과 같은 PHI 유형에서 F-측정치가 열악한 데 기여하는 다른 요인은 무엇인가?
  • RQ4비의료 도메인(예: 법률 또는 검색 로그)에서의 전이 학습이 신규 EHR 데이터에 대한 탈식별 시스템의 적응 능력을 향상시킬 수 있는가?
  • RQ5복잡하고 재현 불가능한 모델 대비 단순하고 재현 가능한 시스템을 통해 경쟁적인 성능을 달성할 수 있는가?

주요 결과

  • 규칙 기반 및 CRF 전용 시스템에서 하이브리드 및 딥 러닝 모델로의 전환은 점진적인 정확도 향상을 가져왔지만, 향상 폭은 미미하며 종종 재현 불가능하다.
  • 특히 수동으로 작성된 규칙에 의존하는 대부분의 시스템은 새로운 데이터셋에 일반화하지 못했으며, 이는 2016년 트랙 1A 대회에서 미리 보지 못한 데이터에서 열악한 성능으로 나타났다.
  • 2016년 트랙 1A 데이터셋에서 평균 성능을 달성한 시스템은 소수에 불과하여 다양한 EHR 소스 간의 심각한 적응 능력 부족을 시사한다.
  • 2014년 데이터로 훈련된 시스템은 대회 후에 이전에 성능이 열악했던 PHI 유형에서 성능 향상을 보였으며, 이는 반복적인 개선과 모델 튜닝의 잠재력을 시사한다.
  • 어휘 임베딩과 의미 모델링은 문법적 또는 규칙 기반 접근보다 희귀 PHI 인스턴스를 더 잘 포착할 수 있으며, 특히 훈련 데이터가 부족한 경우에 유리하다.
  • 진전이 있었음에도 불구하고, 모든 18개의 HIPAA PHI 카테고리에서 95% 준수를 달성하는 시스템은 존재하지 않으며, 종합적인 탈식별에 있어 여전히 도전 과제가 남아 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.