Skip to main content
QUICK REVIEW

[논문 리뷰] Medical Data Augmentation via ChatGPT: A Case Study on Medication Identification and Medication Event Classification

Shouvon Sarker, Lijun Qian|arXiv (Cornell University)|2023. 06. 10.
Machine Learning in Healthcare인용 수 7
한 줄 요약

이 연구는 전자 건강 기록(EHR) 내 약물 식별 및 약물 이벤트 분류 성능을 햖스키기 위해 ChatGPT를 활용한 데이터 증강 프레임워크를 제안한다. 임상 문장의 다양한 맥락적 정확한 다의어 표현을 생성함으로써 훈련 데이터를 향상시키며, 특히 BioClinicalBERT와 RoBERTa-large와 같은 사전 훈련된 BERT 모델을 미세조정할 경우, 약물 이벤트 분류의 재현율과 F1 스코어에서 두드러진 성능 향상을 이룬다.

ABSTRACT

The identification of key factors such as medications, diseases, and relationships within electronic health records and clinical notes has a wide range of applications in the clinical field. In the N2C2 2022 competitions, various tasks were presented to promote the identification of key factors in electronic health records (EHRs) using the Contextualized Medication Event Dataset (CMED). Pretrained large language models (LLMs) demonstrated exceptional performance in these tasks. This study aims to explore the utilization of LLMs, specifically ChatGPT, for data augmentation to overcome the limited availability of annotated data for identifying the key factors in EHRs. Additionally, different pre-trained BERT models, initially trained on extensive datasets like Wikipedia and MIMIC, were employed to develop models for identifying these key variables in EHRs through fine-tuning on augmented datasets. The experimental results of two EHR analysis tasks, namely medication identification and medication event classification, indicate that data augmentation based on ChatGPT proves beneficial in improving performance for both medication identification and medication event classification.

연구 동기 및 목표

  • 대체로 부족한 EHR 데이터 애너테이션 문제를 해결하기 위해 대규모 언어 모델을 활용해 합성 데이터를 생성한다.
  • ChatGPT로 생성된 증강 데이터의 효과성을 평가하여 임상 텍스트에서의 하류 NLP 작업 성능 향상 여부를 검토한다.
  • 원본 및 증강 데이터셋에 대해 다양한 사전 훈련된 BERT 버전을 미세조정하여 약물 관련 분류 작업을 비교한다.
  • LLM를 통한 데이터 증강이 임상 NLP 응용 분야에서 모델의 일반화 능력과 강건성 향상에 기여하는지 조사한다.
  • 저자원 임상 NLP 환경에서의 데이터 증강을 위한 실용적이고 프롬프트 엔지니어링된 파이프라인을 제공한다.

제안 방법

  • 프롬프트 엔지니어링을 통해 ChatGPT를 활용해 원본 EHR 문장을 재구성하여 의미는 같지만 언어적 다양성이 있는 훈련 샘플을 생성한다.
  • 원본 CMED 훈련 데이터와 증강 데이터를 결합하여 확장된 훈련 세트를 구성한다.
  • 확장된 데이터셋에 대해 BioBERT, ClinicalBERT, RoBERTa, BioClinicalBERT 등 다양한 사전 훈련된 BERT 버전을 미세조정한다.
  • 두 가지 N2C2 2022 벤치마크 작업인 약물 식별 및 약물 이벤트 분류에 대해 미세조정된 모델을 평가한다.
  • 엄격한 평가 기준과 유연한 평가 기준(정밀도, 재현율, F1)을 모두 적용하여 매크로 평균 및 마이크로 평균 기준으로 성능을 평가한다.
  • 제로샷 프롬프팅 및 피셔샷 프롬프팅 전략을 활용해 임상 노트에서 다양한 맥락적 정확한 다의어 표현을 생성한다.

실험 결과

연구 질문

  • RQ1ChatGPT로 생성된 데이터 증강은 EHR에서 약물 식별을 위한 BERT 기반 모델의 성능 향상에 기여하는가?
  • RQ2ChatGPT를 통한 데이터 증강은 특히 재현율과 F1 스코어에서 약물 이벤트 분류 성능 향상에 실질적인 기여를 하는가?
  • RQ3증강된 EHR 데이터에 대해 미세조정된 경우 어떤 사전 훈련된 BERT 버전이 가장 높은 성능을 보이는가?
  • RQ4원본 데이터만으로 훈련된 모델와 비교해 증강 데이터로 훈련된 모델의 성능은 다양한 평가 기준에서 어떻게 다른가?
  • RQ5데이터 증강이 저자원 임상 NLP 작업에서의 데이터 부족 문제를 어느 정도 완화하는가?

주요 결과

  • 증강된 RoBERTa-large 모델은 데이터 증강 후 약물 식별에서 매크로 F1 스코어 0.7356, 약물 이벤트 분류에서 0.8268을 기록했다.
  • 데이터 증강은 약물 이벤트 분류의 재현율을 크게 향상시켰으며, 증강된 RoBERTa-large 모델은 매크로 재현율 0.7426을 기록해 증강 없이 훈련한 경우의 0.7235보다 높았다.
  • BioClinicalBERT와 BioRedditBERT는 뛰어난 성능을 보였으며, BioRedditBERT는 약물 식별에서 매크로 F1 스코어 0.6976, 약물 이벤트 분류에서 매크로 재현율 0.7096을 기록했다.
  • RoBERTa-large 모델은 모든 다른 버전보다 뛰어난 성능을 보였으며, 유연한 평가 기준에서 약물 식별에서 매크로 F1 스코어 0.7317, 약물 이벤트 분류에서 F1 스코어 0.8237을 기록했다.
  • 증강 데이터의 사용은 재현율을 비롯한 여러 지표에서 일관된 향상을 이끌었으며, 이는 희귀하거나 복잡한 약물 이벤트 패턴을 더 잘 포착할 수 있음을 시사한다.
  • 결과적으로 LLM 기반의 데이터 증강은 저자원 임상 NLP 작업에서 모델의 일반화 능력을 향상시키는 실현 가능하고 효과적인 전략임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.