Skip to main content
QUICK REVIEW

[论文解读] Diagnostic Reasoning Prompts Reveal the Potential for Large Language Model Interpretability in Medicine

Thomas Savage, Ashwin Nayak|arXiv (Cornell University)|Aug 13, 2023
Machine Learning in Healthcare被引用 7
一句话总结

本研究提出了一组新型诊断推理提示,使GPT-4能够模仿临床医生的逐步推理过程——如鉴别诊断、贝叶斯推理和分析性推理——同时保持较高的诊断准确性。GPT-4在不牺牲准确性的前提下,生成了可解释、基于临床的推理过程,其表现优于GPT-3.5,展现出在医学领域实现可信、透明的大语言模型应用的显著进展。

ABSTRACT

One of the major barriers to using large language models (LLMs) in medicine is the perception they use uninterpretable methods to make clinical decisions that are inherently different from the cognitive processes of clinicians. In this manuscript we develop novel diagnostic reasoning prompts to study whether LLMs can perform clinical reasoning to accurately form a diagnosis. We find that GPT4 can be prompted to mimic the common clinical reasoning processes of clinicians without sacrificing diagnostic accuracy. This is significant because an LLM that can use clinical reasoning to provide an interpretable rationale offers physicians a means to evaluate whether LLMs can be trusted for patient care. Novel prompting methods have the potential to expose the black box of LLMs, bringing them one step closer to safe and effective use in medicine.

研究动机与目标

  • 评估大型语言模型(LLMs)是否可通过结构化提示技术执行具有临床相关性的推理。
  • 评估GPT-4是否能在不损失诊断准确性的前提下,复现核心临床推理过程——包括鉴别诊断、直觉推理、分析性推理和贝叶斯推理。
  • 开发并测试新型提示策略,以揭示大语言模型在医疗决策中“黑箱”特性的内在推理过程。
  • 建立用于评估自由回答形式临床推理任务中大语言模型可解释性的基准。
  • 为未来开发透明、可信的大语言模型在临床工作流中的应用奠定基础。

提出的方法

  • 设计了四种针对特定诊断推理过程的提示,其模型基于标准临床认知流程:鉴别诊断、分析性推理、贝叶斯推理和直觉推理。
  • 采用少样本提示法,每种提示包含两个示例病例,以引导模型在推理过程中的行为。
  • 在经修改的自由回答形式MedQA USMLE数据集(含518个临床病例问题)上评估GPT-3.5和GPT-4的表现。
  • 采用由医生主导的盲评并进行评分者间一致性检验(Cohen’s Kappa = 0.98),以评估回答的准确性。
  • 将传统的思维链(Chain-of-Thought, CoT)提示作为基线进行比较。
  • 使用OpenAI API进行推理,其中GPT-3.5基于Davinci-003模型,GPT-4使用其原生模型;由于提交时不可用,未对GPT-4启用自洽性推理。

实验结果

研究问题

  • RQ1GPT-4是否可通过结构化、受临床启发的推理策略提示,在保持诊断准确性的前提下执行临床推理?
  • RQ2GPT-4在使用诊断推理提示时的表现与传统思维链提示相比如何?
  • RQ3GPT-3.5在使用高级诊断提示时是否表现出类似的可解释性与推理能力?
  • RQ4专用提示技术是否能够揭示大语言模型的内部推理过程,从而减少其在临床场景中的“黑箱”特性?
  • RQ5使用诊断推理提示生成的大语言模型推理过程是否逻辑严谨且临床合理?

主要发现

  • GPT-4在使用传统思维链提示时达到92.5%的诊断准确率,在使用诊断推理提示时为92.3%,表明性能无显著下降。
  • 当使用鉴别诊断、分析性推理和贝叶斯推理提示时,GPT-3.5的准确率显著下降,表明其推理能力有限。
  • GPT-4成功模仿了所有四种临床推理策略——鉴别诊断、分析性推理、贝叶斯推理和直觉推理——同时保持了诊断准确性。
  • 医生对GPT-4生成回答的评分者间一致性达到99%,Cohen’s Kappa为0.98,表明评估具有高度可靠性。
  • 本研究证明,GPT-4能够生成可解释、基于临床的推理过程,表明其为实现可信的大语言模型在医学中的整合提供了可行路径。
  • 结果表明,从GPT-3.5到GPT-4的推理能力实现了显著提升,尤其在结构化、临床推理提示的背景下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。