Skip to main content
QUICK REVIEW

[논문 리뷰] Two-stage Federated Phenotyping and Patient Representation Learning

Dianbo Liu, Dmitriy Dligach|arXiv (Cornell University)|2019. 08. 14.
Machine Learning in Healthcare참고 문헌 21인용 수 7
한 줄 요약

이 논문은 여러 의료 기관 간에 원시 데이터를 공유하지 않고도 환자 표현 모델과 표현 분류 모델을 공동으로 훈련할 수 있도록 하는 두 단계의 분산 학습 프레임워크를 제안한다. MIMIC-III에서의 분산 표현 학습과 i2b2에서의 분산 표현 분류를 활용함으로써, 중심화된 훈련과 유사한 F1 스코어 0.724를 달성하며, 의료 NLP 분야에서 일반화 능력 향상과 개인정보 보호 지향 지식 공유의 가능성을 입증한다.

ABSTRACT

A large percentage of medical information is in unstructured text format in electronic medical record systems. Manual extraction of information from clinical notes is extremely time consuming. Natural language processing has been widely used in recent years for automatic information extraction from medical texts. However, algorithms trained on data from a single healthcare provider are not generalizable and error-prone due to the heterogeneity and uniqueness of medical documents. We develop a two-stage federated natural language processing method that enables utilization of clinical notes from different hospitals or clinics without moving the data, and demonstrate its performance using obesity and comorbities phenotyping as medical task. This approach not only improves the quality of a specific clinical task but also facilitates knowledge progression in the whole healthcare system, which is an essential part of learning health system. To the best of our knowledge, this is the first application of federated machine learning in clinical NLP.

연구 동기 및 목표

  • 라벨이 부족하고 기관 간에 분산되어 있는 경우 정확한 임상 NLP 모델을 훈련하는 데 도전하는 데 목적을 두며.
  • 원시 임상 노트를 이동하거나 집계하지 않고도 환자 표현과 표현 분류 모델 간의 공동 학습을 가능하게 한다.
  • 환자 데이터의 기밀성을 유지하면서도 분산 환경에서의 전이 학습을 통해 표현 분류 성능을 향상시킨다.
  • 비정형 임상 텍스트 분석에서 분산 기계 학습의 실현 가능성과 효과성을 입증한다.

제안 방법

  • 이 방법은 두 단계의 분산 학습 파이프라인을 사용한다: 첫 번째 단계에서 탈식별된 임상 노트를 사용하여 다수의 기관 간에 감독 기반 환자 표현 학습을 수행한다.
  • 첫 번째 단계에서는 MIMIC-III 데이터를 10개의 시로(스일로)로 나누어 임상 개념(CUIs)을 사용하여 조밀한 환자 임베딩을 학습한다.
  • 두 번째 단계에서는 이러한 학습된 표현을 입력 특징으로 사용하여 i2b2 데이터를 3개의 시로로 나누어 표현 분류 모델을 훈련한다.
  • 프레임워크는 원시 데이터를 전송하지 않고도 글로벌 모델 가중치를 업데이트하기 위해 FedAvg 스타일의 집계를 사용하여 기밀성을 보장한다.
  • 모델의 입력으로 CUI 기반 특징을 사용하지만, 이 접근법은 원시 텍스트로도 확장 가능하다.
  • 성능 평가를 위해 두 단계 모두에서 중심화된 훈련과 분산 훈련을 비교하는 7개의 실험 설정을 수행한다.

실험 결과

연구 질문

  • RQ1원시 환자 데이터를 공유하지 않고도 표현 분류와 같은 임상 NLP 작업에 대해 분산 학습을 효과적으로 적용할 수 있는가?
  • RQ2단일 기관 훈련에 비해 분산 환자 표현 학습이 후속 표현 분류 성능을 향상시키는가?
  • RQ3완전히 분산된 두 단계 파이프라인의 성능이 F1 스코어와 모델의 강건성 측면에서 중심화된 훈련과 비교하여 어떻게 되는가?
  • RQ4큰 다양성 있는 데이터셋(MIMIC-III)에서의 전이 학습이 분산 환경에서의 표현 분류 정확도를 얼마나 향상시키는가?
  • RQ5라벨이 부족하고 분산되어 있는 경우, 분산 학습이 임상 NLP에서 데이터 부족성과 이질성을 극복할 수 있는가?

주요 결과

  • 완전히 분산된 두 단계 방법은 i2b2 비만 및 공존 질환 표현 분류 작업에서 F1 스코어 0.724를 달성하여 중심화된 기준값 0.714와 유사한 성능을 보였다.
  • i2b2의 세 기관에서 분산 표현 분류 훈련을 수행한 결과(F1=0.632)는 단일 기관 훈련(F1=0.542)보다 유의미하게 뛰어나며 중심화된 성능과 동일했다.
  • MIMIC-III에서의 분산 표현 학습 후 중심화된 표현 분류를 수행한 결과 F1가 0.714로 향상되어 분산 환경에서의 전이 학습의 유용성을 확인했다.
  • 다양한 무작위 데이터 분할과 모델 초기화 설정에서 완전히 분산된 접근법의 성능는 중심화된 기준값과 통계적으로 유의미한 차이가 없었다.
  • '의심스러운' 케이스의 수가 너무 적어 3개 클래스 분류가 신뢰할 수 없을 경우, 작업이 이진 분류로 단순화되었고, 결과는 원래 i2b2 도전 대회와 유사했다.
  • 본 연구는 분산 학습이 임상 NLP에서 실현 가능하고 효과적이며, 의료 기관 간에 개인정보 보호를 고려한 공동 모델 개발을 가능하게 한다는 점을 처음으로 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.