Skip to main content
QUICK REVIEW

[論文レビュー] Large Language Models are Few-Shot Clinical Information Extractors

Monica Agrawal, Stefan Hegselmann|arXiv (Cornell University)|May 25, 2022
Topic Modeling被引用数 48
ひとこと要約

要約: 本論文は、GPT-3スタイルの大規模言語モデルが、ガイド付きプロンプトと軽量リゾルバを用いて、多様な構造化出力タスクに対してゼロショットおよびFew-shotの臨床情報抽出を実行できることを示し、弱教師あり学習を通じて小型モデルを訓練できることを実証しています。

ABSTRACT

A long-running goal of the clinical NLP community is the extraction of important variables trapped in clinical notes. However, roadblocks have included dataset shift from the general domain and a lack of public clinical corpora and annotations. In this work, we show that large language models, such as InstructGPT, perform well at zero- and few-shot information extraction from clinical text despite not being trained specifically for the clinical domain. Whereas text classification and generation performance have already been studied extensively in such models, here we additionally demonstrate how to leverage them to tackle a diverse set of NLP tasks which require more structured outputs, including span identification, token-level sequence classification, and relation extraction. Further, due to the dearth of available data to evaluate these systems, we introduce new datasets for benchmarking few-shot clinical information extraction based on a manual re-annotation of the CASI dataset for new tasks. On the clinical extraction tasks we studied, the GPT-3 systems significantly outperform existing zero- and few-shot baselines.

研究の動機と目的

  • 大規模言語モデル(LLMs)がドメイン特化の訓練なしにゼロショットおよびFew-shotの臨床情報抽出を行えることを実証する。
  • CASI由来のFew-shot臨床IEタスクの新規注釈データセットを導入する。
  • ガイド付きプロンプトと軽量リゾルバが、構造化出力(スパンの同定、トークンレベルの分類、関係抽出)を可能にすることを示す。
  • 複数の臨床IEタスクにおいて、GPT-3スタイルのシステムをゼロショット、Few-shot、監視付きベースラインと比較評価する。
  • LLM出力からの弱教師付けが、小型でデプロイ可能なモデルの訓練にどのように寄与するかを示す。

提案手法

  • LLM出力を構造化フォーマットへ誘導する一例の一-shotサンプルを含むガイド付きプロンプトテンプレートを設計する。
  • リゾルバRを定義し、LLMの文字列出力をタスク特有の構造化ラベル空間(例:リスト、スパン、関係)へ写像する。
  • CASIの断片を再注釈して、Sense、Evidence抽出、Coreference、Medication status、Medication attributes の5つの臨床IEタスク用に新規データセットを注釈する。
  • GPT-3様システムをゼロショットおよびFew-shotのベースライン、さらに弱教師付けで訓練された蒸留モデルと比較評価する。
  • トークンレベル、フレーズレベル、エンドツーエンドの関係抽出の定式化を、タスク間で比較する。

実験結果

リサーチクエスチョン

  • RQ1GPT-3スタイルのLLMsは、ゼロショットまたはFew-shotプロンプトで、さまざまな臨床IEタスクに対して競合的な性能を達成できるか。
  • RQ2ガイド付きプロンプトとリゾルバは、臨床IEにおける後処理を削減し、構造化出力を改善するか。
  • RQ3LLM出力からの弱教師付けは、より小さくデプロイ可能な臨床IEモデルの訓練にどの程度有効か。
  • RQ4臨床 sense disambiguation、evidence extraction、coreference、および medication extraction に対するLLMベース手法の長所と限界は何か。

主な発見

  • GPT-3 + R(ガイド付きプロンプト使用)を用いると、CASIおよびMIMICのreverse-substitutionで、ゼロショットベースラインを上回る臨床 sense disambiguationを達成できる。
  • PubMedBERTを用いた弱教師付けによりCASIの性能がさらに向上し、MIMICデータへの競争力のある転移を可能にする。
  • 生物医学的証拠抽出において、GPT-3 + Rは、評価設定でいくつかの監視付きベースラインより高いトークンレベルF1およびarm-identificationの精度を示す。
  • GPT-3 + R(1-shot)を用いたコアリファレンス解決は、非臨床の長文ベースラインに対して競争力のリコール/適合率を達成し、特定の設定下でそれらを上回る。
  • Medication extractionタスクは、1-shot GPT-3 + Rが、トークン、フレーズ、関係抽出のいずれの枠組みでもScispaCyベースラインより高い再現率と適合率を示す。
  • 全タスクを通じて、ガイド付きプロンプトはリゾルバの複雑さを低減し(コード行数が通常10行未満になることが多い)、構造化出力を改善する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。