Skip to main content
QUICK REVIEW

[論文レビュー] AE-GPT: Using Large Language Models to Extract Adverse Events from Surveillance Reports-A Use Case with Influenza Vaccine Adverse Events

Yiming Li, Jianfu Li|arXiv (Cornell University)|Sep 28, 2023
Influenza Virus Research StudiesMedicine参考文献 49被引用数 3
ひとこと要約

本研究では、VAERSデータ(1990–2016)を用い、インフルエンザワクチンを事例として、大規模言語モデルを活用してワクチン監視レポートから有害事象(AEs)を抽出するための微調整済みGPT-3.5モデルであるAE-GPTを提案する。モデルは厳密一致基準でF1スコア0.704、緩やかな一致基準で0.816を達成し、公衆衛生監視における自動有害事象抽出の強力な性能と一般化可能性を示している。

ABSTRACT

Though Vaccines are instrumental in global health, mitigating infectious diseases and pandemic outbreaks, they can occasionally lead to adverse events (AEs). Recently, Large Language Models (LLMs) have shown promise in effectively identifying and cataloging AEs within clinical reports. Utilizing data from the Vaccine Adverse Event Reporting System (VAERS) from 1990 to 2016, this study particularly focuses on AEs to evaluate LLMs' capability for AE extraction. A variety of prevalent LLMs, including GPT-2, GPT-3 variants, GPT-4, and Llama 2, were evaluated using Influenza vaccine as a use case. The fine-tuned GPT 3.5 model (AE-GPT) stood out with a 0.704 averaged micro F1 score for strict match and 0.816 for relaxed match. The encouraging performance of the AE-GPT underscores LLMs' potential in processing medical data, indicating a significant stride towards advanced AE detection, thus presumably generalizable to other AE extraction tasks.

研究の動機と目的

  • 大規模言語モデル(LLMs)が非構造化ワクチン監視レポートから有害事象(AEs)を抽出する効果性を評価すること。
  • GPT-2、GPT-3、GPT-4、Llama 2を含む複数のLLMsがVAERSデータからの有害事象抽出に与えるパフォーマンスを評価すること。
  • インフルエンザワクチン関連の有害事象を特定することに最適化された特別なLLM、AE-GPTの開発および微調整を行うこと。
  • このアプローチが薬物異常監視分野における他の有害事象検出タスクへの一般化可能性を特定すること。

提案手法

  • インフルエンザワクチンレポートに焦点を当て、1990–2016年のVAERSデータを用いてGPT-3.5を微調整し、AE-GPTを構築した。
  • 自由記述の監視レポートから有害事象を同定および分類するためのプロンプトベースのアプローチを採用した。
  • 抽出精度の評価に、正確な語句一致を要する厳密一致基準と、意味的類似性を許容する緩やかな一致基準の両方を適用した。
  • GPT-3.5、GPT-4、Llama 2を含む複数のLLMsのパフォーマンスを、マイクロ-F1スコアを用いて評価した。
  • 訓練および評価の主なデータセットとして、ワクチン有害事象報告システム(VAERS)を用いた。
  • ゼロショットおよびフェイントショットのプロンプト技術を採用し、ゼロショット一般化を向上させるとともに、アノテーション依存性を低減した。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデルは、非構造化ワクチン監視レポートから有害事象を効果的に抽出できるか?
  • RQ2AE-GPTのパフォーマンスは、GPT-3.5、GPT-4、Llama 2などの他のLLMsと比較してどのように異なるか?
  • RQ3厳密一致と緩やかな一致基準の違いが、有害事象抽出におけるF1スコアに与える影響は何か?
  • RQ4GPT-3.5を微調整したLLM、たとえばAE-GPTは、他の有害事象検出タスクへどの程度一般化可能か?

主な発見

  • 微調整済みGPT-3.5モデル(AE-GPT)は、有害事象抽出において厳密一致基準でマイクロ-F1スコア0.704を達成した。
  • 緩やかな一致条件では、AE-GPTは顕著に高いF1スコア0.816を達成し、強力な意味的理解力と一般化能力を示した。
  • 評価対象のLLMsの中で、GPT-3.5は厳密一致および緩やかな一致評価の両方で、GPT-2、GPT-4、Llama 2を上回った。
  • 結果から、微調整済みLLMsは、高い正確性と再現率で現実世界の監視データからの有害事象を効果的に処理・抽出できることが示唆された。
  • AE-GPTの成功は、公衆衛生監視システムにおけるスケーラブルで自動化された有害事象検出にLLMsを活用する可能性の実現性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。