Skip to main content
QUICK REVIEW

[論文レビュー] Diagnostic Reasoning Prompts Reveal the Potential for Large Language Model Interpretability in Medicine

Thomas Savage, Ashwin Nayak|arXiv (Cornell University)|Aug 13, 2023
Machine Learning in Healthcare被引用数 7
ひとこと要約

本研究では、GPT-4が臨床医の段階的推論——診断の鑑別、ベイズ推論、分析的推論——を模倣できるようにする、革新的な診断推論プロンプトを導入した。GPT-4は、正確性を損なわずに解釈可能な臨床的根拠を生成し、GPT-3.5を上回った。これは、医療分野における信頼できる、透明性のある大規模言語モデル(LLM)の利用に向けた顕著な進歩を示している。

ABSTRACT

One of the major barriers to using large language models (LLMs) in medicine is the perception they use uninterpretable methods to make clinical decisions that are inherently different from the cognitive processes of clinicians. In this manuscript we develop novel diagnostic reasoning prompts to study whether LLMs can perform clinical reasoning to accurately form a diagnosis. We find that GPT4 can be prompted to mimic the common clinical reasoning processes of clinicians without sacrificing diagnostic accuracy. This is significant because an LLM that can use clinical reasoning to provide an interpretable rationale offers physicians a means to evaluate whether LLMs can be trusted for patient care. Novel prompting methods have the potential to expose the black box of LLMs, bringing them one step closer to safe and effective use in medicine.

研究の動機と目的

  • 大規模言語モデル(LLM)が構造化されたプロンプト技術を用いて、臨床的に関連する推論を実行できるかどうかを評価すること。
  • GPT-4が診断の鑑別、直感的推論、分析的推論、ベイズ推論といった、核心的な臨床的推論プロセスを、診断の正確性を損なわずに再現できるかどうかを評価すること。
  • LLMの『ブラックボックス』性を解消するための、新たなプロンプト戦略の開発と検証を行うこと。
  • 自由入力形式の臨床的推論タスクにおけるLLMの解釈可能性を評価するためのベンチマークを確立すること。
  • 今後の臨床ワークフローにおける透明性があり信頼できるLLMの開発の基盤を提供すること。

提案手法

  • 標準的な臨床的認知プロセスを模倣した4つの特化した診断推論プロンプト(診断の鑑別、分析的推論、ベイズ推論、直感的推論)を開発した。
  • 推論中にモデルの行動を誘導するため、各プロンプトごとに2例の少サンプルプロンプトを用いた。
  • 518件の臨床的症例質問を含む、改変された自由入力形式のMedQA USMLEデータセットを用いて、GPT-3.5およびGPT-4の評価を実施した。
  • 医師主導の盲検評価と評価者間一致性のチェック(Cohen’s Kappa = 0.98)を実施し、回答の正確性を評価した。
  • 比較のためのベースラインとして、従来のチェーン・オブ・トゥーク(CoT)プロンプトを用いた。
  • 推論には、OpenAI APIのDavinci-003(GPT-3.5)およびGPT-4を用い、GPT-4については、提出時における利用不可のため自己一貫性を用いない。

実験結果

リサーチクエスチョン

  • RQ1GPT-4は、診断の鑑別、分析的推論、ベイズ推論、直感的推論といった、医師にインspiredされた構造化された推論戦略を用いたプロンプトで、診断の正確性を維持しながら臨床的推論を実行できるか?
  • RQ2GPT-4が診断推論プロンプトを用いた際のパフォーマンスは、従来のチェーン・オブ・トゥークプロンプトと比べてどうか?
  • RQ3GPT-3.5は、高度な診断推論プロンプトを用いても、同様の解釈可能性と推論能力を示すか?
  • RQ4特化したプロンプト技術は、臨床的文脈におけるLLMの内部推論を明らかにし、ブラックボックス性を軽減できるか?
  • RQ5診断推論プロンプトを用いて生成されたLLMの根拠は、論理的かつ臨床的に妥当なものか?

主な発見

  • GPT-4は、従来のチェーン・オブ・トゥークプロンプトを用いた場合に92.5%、診断推論プロンプトを用いた場合に92.3%の診断正確性を達成し、有意なパフォーマンス低下は認めなかった。
  • GPT-3.5は、診断の鑑別、分析的推論、ベイズ推論プロンプトを用いた際、正確性が著しく低下し、推論能力に限界があることが示された。
  • GPT-4は、診断の鑑別、分析的推論、ベイズ推論、直感的推論の4つの臨床的推論戦略を、診断正確性を維持したまま成功裏に模倣した。
  • 医師によるGPT-4の回答評価における評価者間一致性は99%で、Cohen’s Kappaは0.98であった。これは、評価の高い信頼性を示している。
  • 本研究では、GPT-4が解釈可能で臨床的根拠に基づいた根拠を生成できることを示しており、医療分野における信頼できるLLM統合への道筋を示唆している。
  • 結果から、GPT-3.5からGPT-4にかけて、特に構造化された臨床的推論プロンプトの文脈において、推論能力が顕著に向上していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。