[논문 리뷰] AE-GPT: Using Large Language Models to Extract Adverse Events from Surveillance Reports-A Use Case with Influenza Vaccine Adverse Events
이 연구는 1990–2016년도의 VAERS 데이터를 활용하여 인플루엔자 백신을 사례로 삼아, 대규모 언어 모델을 활용해 백신 감시 보고서에서 부작용(AE)을 추출하는 데에 최적화된 미세조정된 GPT-3.5 모델인 AE-GPT를 소개한다. 모델은 엄격한 일치 기준에서 F1 스코어 0.704, 유연한 일치 기준에서 0.816을 기록하여 자동 부작용 추출의 높은 성능과 일반화 능력을 입증하였다.
Though Vaccines are instrumental in global health, mitigating infectious diseases and pandemic outbreaks, they can occasionally lead to adverse events (AEs). Recently, Large Language Models (LLMs) have shown promise in effectively identifying and cataloging AEs within clinical reports. Utilizing data from the Vaccine Adverse Event Reporting System (VAERS) from 1990 to 2016, this study particularly focuses on AEs to evaluate LLMs' capability for AE extraction. A variety of prevalent LLMs, including GPT-2, GPT-3 variants, GPT-4, and Llama 2, were evaluated using Influenza vaccine as a use case. The fine-tuned GPT 3.5 model (AE-GPT) stood out with a 0.704 averaged micro F1 score for strict match and 0.816 for relaxed match. The encouraging performance of the AE-GPT underscores LLMs' potential in processing medical data, indicating a significant stride towards advanced AE detection, thus presumably generalizable to other AE extraction tasks.
연구 동기 및 목표
- 비정형 백신 감시 보고서에서 부작용(AE)을 추출하는 데에 대규모 언어 모델(LLMs)의 효과성을 평가하는 것.
- GPT-2, GPT-3, GPT-4 및 Llama 2를 포함한 여러 LLM의 VAERS 데이터에서의 부작용 추출 성능을 평가하는 것.
- 인플루엔자 백신과 관련된 부작용을 식별하기 위해 최적화된 전용 LLM인 AE-GPT를 개발하고 미세조정하는 것.
- 이 접근 방식이 약물감시 분야의 다른 부작용 탐지 작업으로의 일반화 가능성 여부를 규명하는 것.
제안 방법
- 1990–2016년도 VAERS 데이터를 기반으로 인플루엔자 백신 보고서에 집중하여 GPT-3.5를 미세조정하여 AE-GPT를 구축함.
- 자연어 기반의 감시 보고서에서 부작용을 식별하고 분류하도록 지시하기 위해 프롬프트 기반의 프롬프팅 전략을 사용함.
- 추출 정확도 평가를 위해 엄격한 일치 기준(정확한 용어 일치 필요)과 유연한 일치 기준(의미적 유사성 允許)을 모두 적용함.
- GPT-3.5, GPT-4 및 Llama 2를 포함한 여러 LLM의 성능을 마이크로-F1 스코어 기반으로 평가함.
- 학습 및 평가의 주요 데이터셋으로 백신 부작용 보고 시스템(VAERS)을 활용함.
- 초기 지침 및 소수의 예시를 활용한 프롬프팅 기법을 도입하여 초기 지침 일반화 능력을 향상시키고 애너테이션 의존도를 감소시킴.
실험 결과
연구 질문
- RQ1대규모 언어 모델은 비정형 백신 감시 보고서에서 부작용을 효과적으로 추출할 수 있는가?
- RQ2AE-GPT의 성능은 GPT-3.5, GPT-4 및 Llama 2와 같은 다른 LLM과 비교해 어떻게 되는가?
- RQ3엄격한 일치 기준과 유연한 일치 기준이 부작용 추출의 F1 스코어 성능에 미치는 영향은 무엇인가?
- RQ4AE-GPT와 같은 미세조정된 LLM은 다른 부작용 탐지 작업으로 얼마나 일반화될 수 있는가?
주요 결과
- 미세조정된 GPT-3.5 모델(AE-GPT)은 엄격한 일치 기준에서 부작용 추출에 대해 마이크로-F1 스코어 0.704를 기록함.
- 유연한 일치 조건에서는 AE-GPT가 유의미하게 높은 F1 스코어 0.816을 기록하여 강력한 의미적 이해 및 일반화 능력을 보임.
- 평가된 LLM 중에서 GPT-3.5는 엄격한 일치 평가와 유연한 일치 평가 양쪽 모두에서 GPT-2, GPT-4 및 Llama 2를 앞서는 성능을 보임.
- 결과는 미세조정된 LLM이 높은 정밀도와 재현율을 바탕으로 실제 감시 데이터에서 부작용을 효과적으로 처리하고 추출할 수 있음을 시사함.
- AE-GPT의 성공은 대규모 언어 모델을 활용한 공중보건 모니터링 시스템에서 확장 가능하고 자동화된 부작용 탐지의 실현 가능성을 입증함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.