Skip to main content
QUICK REVIEW

[論文レビュー] Deciphering Diagnoses: How Large Language Models Explanations Influence Clinical Decision Making

Dmitriy Umerenkov, Galina Zubkova|arXiv (Cornell University)|Oct 3, 2023
Machine Learning in HealthcareComputer Science被引用数 3
ひとこと要約

本研究は、大規模言語モデル(LLM)が患者の訴状と診断を結びつける説明をどのように生成するかを評価し、LLMによる説明が医師の診断への合意を顕著に高める一方で、5%~30%のケースで誤りを含んでおり、主に症状と診断の関連を過剰に解釈することに起因することを明らかにした。本研究は、LLMの臨床意思決定支援における説得力の高さを浮き彫りにするとともに、事実誤認のリスクも強調している。

ABSTRACT

Clinical Decision Support Systems (CDSS) utilize evidence-based knowledge and patient data to offer real-time recommendations, with Large Language Models (LLMs) emerging as a promising tool to generate plain-text explanations for medical decisions. This study explores the effectiveness and reliability of LLMs in generating explanations for diagnoses based on patient complaints. Three experienced doctors evaluated LLM-generated explanations of the connection between patient complaints and doctor and model-assigned diagnoses across several stages. Experimental results demonstrated that LLM explanations significantly increased doctors' agreement rates with given diagnoses and highlighted potential errors in LLM outputs, ranging from 5% to 30%. The study underscores the potential and challenges of LLMs in healthcare and emphasizes the need for careful integration and evaluation to ensure patient safety and optimal clinical utility.

研究の動機と目的

  • 医師の臨床的意思決定に与えるLLM生成説明の影響を評価すること。
  • 患者の訴状と医学的診断を結びつけるLLM説明の質および事実的正確性を評価すること。
  • LLMが生成する医学的説明における一般的な誤りパターンを同定すること。
  • 説明が経験豊富な臨床医間の診断合意率に与える影響を検討すること。
  • 臨床意思決定支援システム(CDSS)へのLLM統合におけるリスクと機会を浮き彫りにすること。

提案手法

  • 3名の経験豊富な医師が、患者の訴状と診断に係るLLM生成説明を段階的に評価する多段階実験を実施した。
  • 電子健康記録(EHR)風の訴状に基づき、LLMが症状と診断を結びつける平易な文章による説明を生成した。
  • 初期診断、LLM説明の提示後、および説明の質に関する評価の各段階で医師の評価を収集・分析した。
  • LLM説明の提示前後における医師と診断の合意率を定量的に分析した。
  • 事実誤認、過剰解釈、症状の誤った帰属を焦点に、LLMの誤りに関する定性的分析を実施した。
  • 医師が行った診断とLLMが生成した診断を比較し、一貫性と信頼性を評価した。
Figure 1: Inter-doctor agreement on what explanations are erroneous for GT predictions
Figure 1: Inter-doctor agreement on what explanations are erroneous for GT predictions

実験結果

リサーチクエスチョン

  • RQ1LLMが生成する説明は、医師が提示された診断仮説に合意する割合にどのように影響を与えるか?
  • RQ2LLMが患者の訴状と診断の関連を説明する際、一般的にどのような事実誤認を行うか?
  • RQ3異なる症状-診断ペアにおいて、LLMの説明の質はどのように変動するか?
  • RQ4臨床的判断のみに依存する場合と比較して、LLMの説明は診断意思決定にどの程度影響を与えるか?
  • RQ5医師はLLMが生成する説明の明確さと臨床的妥当性をどのように評価するか?

主な発見

  • LLMが生成する説明は、提示された診断に医師が合意する割合を顕著に高め、説得的効果を示した。
  • LLMの誤り率は5%~30%の範囲にあり、最も一般的な誤りは症状が誤った診断に帰属されることであった。
  • 主な誤りタイプとして、存在しない症状-診断の関連をモデルが「創出」する傾向が顕著で、特に症状が診断を明確に支持しない場合に顕著であった。
  • 医師はしばしばLLM説明の事実誤認に気づかず、むしろ症状が診断と整合しているかどうかに注目していた。
  • 本研究では、同じ症状セットに対して複数の妥当な診断仮説が存在しうることを明らかにしたが、LLMの説明が医師がどの診断を受け入れるかに影響を与えた。
  • 多くの場合、高品質な説明が生成されていたにもかかわらず、医師間での説明の質に対する合意は低く、説明の質の評価が主観的かつ文脈依存的であることが示された。
Figure 2: Inter-doctor agreement on what explanations are erroneous for MODEL predictions
Figure 2: Inter-doctor agreement on what explanations are erroneous for MODEL predictions

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。