[论文解读] AE-GPT: Using Large Language Models to Extract Adverse Events from Surveillance Reports-A Use Case with Influenza Vaccine Adverse Events
本研究提出 AE-GPT,一种微调后的 GPT-3.5 模型,利用大语言模型从疫苗监测报告中提取不良事件(AEs),以 VAERS 数据(1990–2016)为案例研究,聚焦于流感疫苗。该模型在严格匹配下的 F1 得分为 0.704,在宽松匹配下的 F1 得分为 0.816,展现出在公共卫生监测中自动化提取不良事件的强劲性能与泛化能力。
Though Vaccines are instrumental in global health, mitigating infectious diseases and pandemic outbreaks, they can occasionally lead to adverse events (AEs). Recently, Large Language Models (LLMs) have shown promise in effectively identifying and cataloging AEs within clinical reports. Utilizing data from the Vaccine Adverse Event Reporting System (VAERS) from 1990 to 2016, this study particularly focuses on AEs to evaluate LLMs' capability for AE extraction. A variety of prevalent LLMs, including GPT-2, GPT-3 variants, GPT-4, and Llama 2, were evaluated using Influenza vaccine as a use case. The fine-tuned GPT 3.5 model (AE-GPT) stood out with a 0.704 averaged micro F1 score for strict match and 0.816 for relaxed match. The encouraging performance of the AE-GPT underscores LLMs' potential in processing medical data, indicating a significant stride towards advanced AE detection, thus presumably generalizable to other AE extraction tasks.
研究动机与目标
- 评估大语言模型(LLMs)从非结构化疫苗监测报告中提取不良事件(AEs)的有效性。
- 评估多种 LLM(包括 GPT-2、GPT-3、GPT-4 和 Llama 2)在 VAERS 数据中提取 AEs 的性能。
- 开发并微调一种专用 LLM,即 AE-GPT,以优化识别与流感疫苗相关的 AEs。
- 确定该方法在药物警戒领域其他不良事件检测任务中的泛化能力。
提出的方法
- 在 1990–2016 年的 VAERS 数据上微调 GPT-3.5,专注于流感疫苗报告,以构建 AE-GPT。
- 采用基于提示的提示策略,引导 LLM 从自由文本监测报告中识别和分类不良事件。
- 应用严格匹配和宽松匹配两种标准评估提取准确性,其中严格匹配要求术语完全一致,宽松匹配则允许语义相似性。
- 使用微调后的 F1 得分评估多种 LLM(包括 GPT-3.5、GPT-4 和 Llama 2)的性能。
- 将疫苗不良事件报告系统(VAERS)作为训练和评估的主要数据集。
- 采用零样本和少样本提示技术,以增强零样本泛化能力并减少对标注数据的依赖。
实验结果
研究问题
- RQ1大语言模型能否有效从非结构化疫苗监测报告中提取不良事件?
- RQ2AE-GPT 在不良事件提取任务中与 GPT-3.5、GPT-4 和 Llama 2 等其他 LLM 的性能相比如何?
- RQ3严格匹配与宽松匹配标准对不良事件提取中 F1 得分表现有何影响?
- RQ4微调后的 LLM(如 AE-GPT)在多大程度上可泛化至其他不良事件检测任务?
主要发现
- 微调后的 GPT-3.5 模型(即 AE-GPT)在严格匹配标准下,不良事件提取的微调 F1 得分为 0.704。
- 在宽松匹配条件下,AE-GPT 的 F1 得分显著提高至 0.816,表明其具备强大的语义理解与泛化能力。
- 在评估的 LLM 中,GPT-3.5 在严格和宽松匹配评估中均优于 GPT-2、GPT-4 和 Llama 2。
- 结果表明,微调后的 LLM 能够有效处理并从真实世界监测数据中提取 AEs,具备高精确率与高召回率。
- AE-GPT 的成功证明了利用 LLM 实现可扩展、自动化的不良事件检测在公共卫生监测系统中的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。