Skip to main content
QUICK REVIEW

[논문 리뷰] Comparing Rule-based, Feature-based and Deep Neural Methods for De-identification of Dutch Medical Records

Jan Trienes, Dolf Trieschnigg|arXiv (Cornell University)|2020. 01. 16.
Topic Modeling참고 문헌 31인용 수 6
한 줄 요약

이 연구는 네덜란드 의료 기록의 규칙 기반, 특징 기반, 딥 네트워크 방법을 세 가지 의료 분야에서 평가한다. BiLSTM-CRF 모델은 도메인 간 및 다국어 설정에서 규칙 기반 및 CRF 방법보다 뛰어난 성능을 보이며, 최소한의 설정으로도 일반화 능력이 뛰어나며, 제한된 데이터에서도 성능을 유지한다. 반면 네덜란드 전용 규칙 기반 시스템은 원래 도메인을 초월해 일반화하지 못한다.

ABSTRACT

Unstructured information in electronic health records provide an invaluable resource for medical research. To protect the confidentiality of patients and to conform to privacy regulations, de-identification methods automatically remove personally identifying information from these medical records. However, due to the unavailability of labeled data, most existing research is constrained to English medical text and little is known about the generalizability of de-identification methods across languages and domains. In this study, we construct a varied dataset consisting of the medical records of 1260 patients by sampling data from 9 institutes and three domains of Dutch healthcare. We test the generalizability of three de-identification methods across languages and domains. Our experiments show that an existing rule-based method specifically developed for the Dutch language fails to generalize to this new data. Furthermore, a state-of-the-art neural architecture performs strongly across languages and domains, even with limited training data. Compared to feature-based and rule-based methods the neural method requires significantly less configuration effort and domain-knowledge. We make all code and pre-trained de-identification models available to the research community, allowing practitioners to apply them to their datasets and to enable future benchmarks.

연구 동기 및 목표

  • 네덜란드 의료 분야에서 언어 및 의료 도메인 간 익명화 방법의 일반화 능력을 평가한다.
  • 기존의 네덜란드 익명화를 위한 규칙 기반 및 특징 기반 방법이 새로운 도메인과 데이터 소스로 일반화되는지 평가한다.
  • 저자원 환경에서 도메인 간 설정으로 네덜란드 의료 텍스트에 대해 최신 딥 네트워크의 성능을 조사한다.
  • 향후 벤치마킹 및 多국어·다중 도메인 익명화 연구를 지원하기 위해 공개된 데이터셋과 미리 훈련된 모델을 제공한다.

제안 방법

  • 노인 간호, 정신 간호, 장애인 간호의 세 도메인에서 9개 기관으로부터 1,260건의 네덜란드 의료 기록을 수집하여 새로운 데이터셋을 구축했다.
  • 18개의 HIPAA 정의 카테고리(이름, 날짜, 주소, 전화번호 포함)를 사용하여 보호된 건강정보(PHI)를 주석 처리했다.
  • 세 가지 익명화 방법을 평가했다: 네덜란드 정신과 기록 전용 규칙 기반 시스템(Deduce), CRF 기반 특징 모델, BiLSTM-CRF 신경망.
  • 모델을 한 도메인에서 훈련하고 나머지 두 도메인에서 테스트하는 도메인 간 전이 학습을 사용하여 훈련 및 테스트를 수행했다.
  • 영어 데이터셋(e.g., HUGO, i2b2)에서의 성능을 평가하여 다국어 전이 가능성 여부를 점검했다.
  • 모든 방법과 설정에서 실체 수준 평가를 위해 마이크로 평균 F1 스코어를 사용했다.
Figure 2. Entity-level F1-score for varying training set sizes. The full training set (100%) consists of all training and validation sentences in NUT (34,714). The F1-score is measured on the test set. For each subset size, we draw 3 random samples and train/test each model 3 times. The lines show t
Figure 2. Entity-level F1-score for varying training set sizes. The full training set (100%) consists of all training and validation sentences in NUT (34,714). The F1-score is measured on the test set. For each subset size, we draw 3 random samples and train/test each model 3 times. The lines show t

실험 결과

연구 질문

  • RQ1네덜란드 정신과 기록 전용으로 설계된 규칙 기반 익명화 시스템이 다른 네덜란드 의료 도메인으로 일반화될 수 있는가?
  • RQ2다양한 네덜란드 의료 도메인에서 특징 기반 및 딥 네트워크 방법의 성능 및 설정 노력은 어떻게 비교되는가?
  • RQ3제한된 데이터로 훈련된 사전 훈련된 BiLSTM-CRF 모델이 언어 및 도메인 간에 얼마나 일반화되는가?
  • RQ4도메인 내 및 도메인 간 익명화 간 성능 격차는 무엇이며, 이는 각 방법에 따라 어떻게 달라지는가?

주요 결과

  • 정신과 기록 전용으로 설계된 규칙 기반 시스템 DEDUCE는 노인 간호에서 F1 0.683, 장애인 간호에서 F1 0.565를 기록하여 도메인 간 일반화 능력이 떨어지는 것으로 나타났다.
  • CRF 기반 방법은 도메인 간 F1 스코어가 0.414에서 0.719 사이로 변동하여 도메인 이동에 대한 저항력이 제한됨을 보였다.
  • BiLSTM-CRF 모델은 모든 도메인에서 최고 성능을 기록했으며, 노인 간호에서 F1 0.775, 장애인 간호에서 F1 0.775, 정신 간호에서 F1 0.839를 기록하여 강력한 일반화 능력을 입증했다.
  • 도메인 간 전이 학습에서 BiLSTM-CRF 모델은 도메인 내에서의 최고 성능(F1 0.919)에서 도메인 간으로 이동할 경우 최대 F1 0.221 감소(0.919 → 0.698)를 보였으며, 이는 성능 저하 문제가 여전히 존재함을 시사한다.
  • 훈련 데이터가 제한적(도메인당 420건)임에도 불구하고 BiLSTM-CRF 모델은 높은 성능을 유지하여 낮은 데이터 및 설정 요구 조건을 갖는 것으로 나타났다.
  • 연구는 전문직 및 유사어구가 여전히 익명화하기 가장 어려운 PHI 유형임을 밝혀내었으며, 향후 개선된 모델링 전략이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.