Skip to main content
QUICK REVIEW

[논문 리뷰] Large Language Models to Identify Social Determinants of Health in Electronic Health Records

Marco Guevara, Shan Chen|arXiv (Cornell University)|2023. 08. 11.
Chronic Disease Management Strategies인용 수 7
한 줄 요약

이 연구는 자유형식 전자건강기록(EHR)에서 사회적 건강 결정요인(SDoH)을 추출하기 위해 미세조정된 대규모 언어모델(LLM)을 평가하며, 합성 데이터 증강이 특히 소형 모델에서 성능을 향상시키고 알고리즘적 편향을 감소시킨다는 것을 입증한다. 최고의 모델은 SDoH 식별에서 매크로-F1 점수 0.71을 기록했으며, 제로-샷 및 희소-샷 GPT 버전을 능가했고, ICD-10 코드로는 2.0%에 불과한 환자 중 93.8%의 부정적인 SDoH를 파악했다.

ABSTRACT

Social determinants of health (SDoH) have an important impact on patient outcomes but are incompletely collected from the electronic health records (EHR). This study researched the ability of large language models to extract SDoH from free text in EHRs, where they are most commonly documented, and explored the role of synthetic clinical text for improving the extraction of these scarcely documented, yet extremely valuable, clinical data. 800 patient notes were annotated for SDoH categories, and several transformer-based models were evaluated. The study also experimented with synthetic data generation and assessed for algorithmic bias. Our best-performing models were fine-tuned Flan-T5 XL (macro-F1 0.71) for any SDoH, and Flan-T5 XXL (macro-F1 0.70). The benefit of augmenting fine-tuning with synthetic data varied across model architecture and size, with smaller Flan-T5 models (base and large) showing the greatest improvements in performance (delta F1 +0.12 to +0.23). Model performance was similar on the in-hospital system dataset but worse on the MIMIC-III dataset. Our best-performing fine-tuned models outperformed zero- and few-shot performance of ChatGPT-family models for both tasks. These fine-tuned models were less likely than ChatGPT to change their prediction when race/ethnicity and gender descriptors were added to the text, suggesting less algorithmic bias (p<0.05). At the patient-level, our models identified 93.8% of patients with adverse SDoH, while ICD-10 codes captured 2.0%. Our method can effectively extracted SDoH information from clinic notes, performing better compare to GPT zero- and few-shot settings. These models could enhance real-world evidence on SDoH and aid in identifying patients needing social support.

연구 동기 및 목표

  • 전자건강기록(EHR)에 기록되지 않은 사회적 건강 결정요인(SDoH)의 부족 기록 문제를 해결하기 위해, 이는 환자 결과에 상당한 영향을 미친다.
  • 비정형 임상 노트에서 SDoH를 추출하는 데에 대규모 언어모델(LLM)의 효과성을 평가하기 위해.
  • 합성 임상 텍스트가 자원이 부족한 환경에서 SDoH 추출 성능을 향상시키는지 조사하기 위해.
  • 특히 인종 및 성별 기술자에 대해 알고리즘적 편향이 LLM에서 어떻게 영향을 미치는지 평가하기 위해.
  • SDoH 탐지 정확도와 내구성에서 미세조정된 LLM과 제로-샷 및 희소-샷 GPT 모델 간의 성능을 비교하기 위해.

제안 방법

  • 평가를 위한 골드 표준 데이터셋을 만들기 위해 800명의 환자 노트를 10개의 SDoH 카테고리로 레이블링했다.
  • 레이블링된 EHR 데이터를 기반으로 Flan-T5 base, large, XL, XXL 버전을 포함한 여러 트랜스포머 기반 LLM을 미세조정했다.
  • 프롬프트 엔지니어링과 LLM을 사용해 합성 임상 텍스트를 생성하여 훈련 데이터를 증강하고 모델 일반화 능력을 향상시켰다.
  • 입원 환자 EHR와 MIMIC-III 데이터셋에서 매크로-F1 점수를 사용해 모델 성능을 평가했다.
  • 입력 프롬프트에 인종/민족 및 성별 기술자를 수정하여 예측 일관성을 측정함으로써 알고리즘적 편향을 평가했다.
  • 성능 차이를 평가하기 위해 GPT 패밀리 모델을 사용한 제로-샷 및 희소-샷 추론과 미세조정된 모델을 비교했다.

실험 결과

연구 질문

  • RQ1미세조정된 대규모 언어모델은 비정형 EHR 노트에서 사회적 건강 결정요인을 효과적으로 추출할 수 있는가?
  • RQ2합성 데이터 생성이 특히 자원이 부족한 환경에서 LLM의 SDoH 식별 성능을 향상시키는가?
  • RQ3인종, 성별 등 인구통계학적 기술자 포함 여부가 LLM의 예측 안정성과 알고리즘적 편향에 어떤 영향을 미치는가?
  • RQ4미세조정된 LLM은 제로-샷 및 희소-샷 GPT 모델에 비해 SDoH 탐지 성능에서 어떻게 다를까?
  • RQ5LLM은 전통적인 ICD-10 코드에 비해 부정적인 SDoH를 가진 환자를 얼마나 잘 식별할 수 있는가?

주요 결과

  • 최고의 성능을 보인 모델인 미세조정된 Flan-T5 XL은 SDoH 탐지에서 매크로-F1 점수 0.71을 기록했다.
  • 작은 Flan-T5 모델들(기본형 및 대형형)은 합성 데이터 증강으로 인해 가장 큰 성능 향상을 보였으며, F1 점수 개선 폭은 +0.12에서 +0.23에 이르렀다.
  • Race/ethnicity 및 성별 기술자가 추가되었을 때, ChatGPT에 비해 예측을 변경할 가능성이 훨씬 낮아, 알고리즘적 편향이 감소했다(p < 0.05).
  • 최고의 미세조정된 모델들은 SDoH 추출 및 예측 안정성에서 모두 제로-샷 및 희소-샷 GPT 패밀리 모델을 능가했다.
  • 환자 수준에서 최고의 모델들은 ICD-10 코드로는 2.0%에 불과한 환자 중 93.8%의 부정적인 SDoH를 식별했다.
  • 모델 성능은 입원 환자 EHR 데이터에서는 일관되었지만, MIMIC-III 데이터셋에서는 낮아, 도메인 이동 문제를 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.