Skip to main content
QUICK REVIEW

[論文レビュー] Large Language Models in Medical Term Classification and Unexpected Misalignment Between Response and Reasoning

Xiaodan Zhang, Sandeep Vemulapalli|arXiv (Cornell University)|Dec 19, 2023
Machine Learning in Healthcare被引用数 4
ひとこと要約

本研究では、MIMIC-IV v2.2 データセットを用いて、GPT-4、GPT-3.5、Falcon、LLaMA 2 などの最先端の大規模言語モデル(LLM)が、臨床的退院要約から軽度認知障害(MCI)を分類する能力を評価している。GPT-4 は強力な推論力と解釈可能性を示すが、その推論と最終的な回答との間に顕著な不一致を示しており、高い性能にもかかわらず、臨床的応用における信頼性に深刻なギャップが存在することが浮き彫りになった。

ABSTRACT

This study assesses the ability of state-of-the-art large language models (LLMs) including GPT-3.5, GPT-4, Falcon, and LLaMA 2 to identify patients with mild cognitive impairment (MCI) from discharge summaries and examines instances where the models' responses were misaligned with their reasoning. Utilizing the MIMIC-IV v2.2 database, we focused on a cohort aged 65 and older, verifying MCI diagnoses against ICD codes and expert evaluations. The data was partitioned into training, validation, and testing sets in a 7:2:1 ratio for model fine-tuning and evaluation, with an additional metastatic cancer dataset from MIMIC III used to further assess reasoning consistency. GPT-4 demonstrated superior interpretative capabilities, particularly in response to complex prompts, yet displayed notable response-reasoning inconsistencies. In contrast, open-source models like Falcon and LLaMA 2 achieved high accuracy but lacked explanatory reasoning, underscoring the necessity for further research to optimize both performance and interpretability. The study emphasizes the significance of prompt engineering and the need for further exploration into the unexpected reasoning-response misalignment observed in GPT-4. The results underscore the promise of incorporating LLMs into healthcare diagnostics, contingent upon methodological advancements to ensure accuracy and clinical coherence of AI-generated outputs, thereby improving the trustworthiness of LLMs for medical decision-making.

研究の動機と目的

  • 臨床的退院要約から軽度認知障害(MCI)を同定するための最先端LLMのパフォーマンスを評価すること。
  • LLMが生成する推論と最終的な分類結果との一貫性を調査すること。
  • 特許取得済みモデル(例:GPT-4)とオープンソースモデル(例:Falcon、LLaMA 2)の解釈可能性と正確性を比較すること。
  • プロンプト工学がモデルの行動および臨床的整合性に与える影響を評価すること。
  • LLMを信頼できる医療診断に導入する際の方法論的課題を特定すること。

提案手法

  • 65歳以上の患者からなるMIMIC-IV v2.2 データの7:2:1の訓練/検証/テスト分割に、MCIの確定診断(ICDコードおよび専門家レビューによる)を用いて、LLMをファインチューニングした。
  • 詳細な推論を引き出すために、分類の前段階で複雑で多段階のプロンプトを使用した。
  • Gold-standardのMCI診断と照らし合わせて、モデルの出力が推論と最終回答の不一致を示すかを評価した。
  • MIMIC-IIIから得た転移性癌のデータセットを用いて、分野を越えた推論の一貫性をテストするアブレーションスタディを実施した。
  • 正確性と解釈可能性の両面から、特許取得済みモデル(GPT-4、GPT-3.5)とオープンソースモデル(Falcon、LLaMA 2)のパフォーマンスを比較した。
  • 定性的および定量的分析を用いて、推論ステップと最終予測との整合性を測定した。

実験結果

リサーチクエスチョン

  • RQ1LLMは、臨床的退院要約から軽度認知障害をどの程度正確に分類できるか?
  • RQ2LLMの推論プロセスは、その最終的な分類結果とどの程度整合しているか?
  • RQ3GPT-4 などの特許取得済みモデルと、Falcon や LLaMA 2 などのオープンソースモデルは、正確性と解釈可能性の観点でどのように比較できるか?
  • RQ4プロンプト工学は、LLMが出力する推論の整合性と臨床的整合性を向上させるか?
  • RQ5MCI や転移性癌のような異なる医学的状態において、推論の一貫性はどの程度一般化可能か?

主な発見

  • GPT-4 は、特に複雑なプロンプト環境下で優れた解釈能力を示したが、推論と最終回答との間に顕著な不一致を示した。
  • Falcon や LLaMA 2 などのオープンソースモデルは高い分類正確性を達成したが、詳細かつ一貫性のある推論が不足しており、臨床的信頼性に制限があった。
  • 高いパフォーマンスにもかかわらず、GPT-4 の推論はしばしば最終予測を論理的に裏付けず、信頼性の欠如が顕著に現れた。
  • 本研究では、GPT-4 において、特に複雑または曖昧な臨床的プロンプト下で、推論と回答の不一致が繰り返し観察された。
  • 転移性癌サブセットでのパフォーマンスは、推論の不整合性が異なる医学的状態間でも継続することを確認し、根本的な問題である可能性を示唆した。
  • 結果として、高精度だけでは不十分であり、信頼できる医療分野におけるAIの実装には、推論の整合性と解釈可能性が不可欠であることが強調された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。