Skip to main content
QUICK REVIEW

[论文解读] Large Language Models are Clinical Reasoners: Reasoning-Aware Diagnosis Framework with Prompt-Generated Rationales

Taeyoon Kwon, Kai Tzu-iunn Ong|arXiv (Cornell University)|Dec 12, 2023
Topic Modeling被引用 5
一句话总结

本文提出了一种推理感知的诊断框架,利用大语言模型(LLMs)生成临床推理过程——称为临床思维链(Clinical CoT)——用于阿尔茨海默病的诊断。通过提示LLMs对患者数据进行逐步推理,该框架提高了诊断准确率,并生成类人的推理过程,表明LLMs能够以时间与人力效率更高的方式有效建模临床推理。

ABSTRACT

Machine reasoning has made great progress in recent years owing to large language models (LLMs). In the clinical domain, however, most NLP-driven projects mainly focus on clinical classification or reading comprehension, and under-explore clinical reasoning for disease diagnosis due to the expensive rationale annotation with clinicians. In this work, we present a "reasoning-aware" diagnosis framework that rationalizes the diagnostic process via prompt-based learning in a time- and labor-efficient manner, and learns to reason over the prompt-generated rationales. Specifically, we address the clinical reasoning for disease diagnosis, where the LLM generates diagnostic rationales providing its insight on presented patient data and the reasoning path towards the diagnosis, namely Clinical Chain-of-Thought (Clinical CoT). We empirically demonstrate LLMs/LMs' ability of clinical reasoning via extensive experiments and analyses on both rationale generation and disease diagnosis in various settings. We further propose a novel set of criteria for evaluating machine-generated rationales' potential for real-world clinical settings, facilitating and benefiting future research in this area.

研究动机与目标

  • 解决现有NLP与深度学习方法在疾病诊断中缺乏临床推理的问题,这些方法通常将诊断视为简单的分类任务。
  • 通过基于提示的学习方法,利用LLM生成高质量的临床推理过程,以克服昂贵且耗时的推理标注挑战。
  • 开发一种实用框架,集成推理生成、少样本诊断与知识蒸馏,适用于现实临床环境的部署。
  • 建立新型评估标准,用于评估机器生成推理过程的临床相关性与推理质量。
  • 证明LLMs能够在诊断决策中复现类人的临床推理,从而增强AI驱动医疗中的信任度与可解释性。

提出的方法

  • 将临床推理形式化为临床思维链(Clinical CoT),即LLMs基于患者数据生成自然语言推理过程,解释其诊断推理逻辑。
  • 采用少样本提示法,使用两个示例推理过程引导LLM为新患者病例生成推理路径。
  • 通过知识蒸馏训练学生模型,将LLM的推理与诊断能力迁移至更小、更易部署的模型中。
  • 将推理生成与诊断整合至自回归生成流程中,使推理与诊断按顺序生成。
  • 设计一套新型评估标准,用于评估机器生成推理过程的临床准确性、逻辑一致性以及与专家推理的一致性。
  • 在包含多模态数据(MRI、认知评分、APOE状态)的测试数据集上应用该框架,利用现有临床知识进行诊断。

实验结果

研究问题

  • RQ1LLMs能否生成具有临床意义的推理过程,以反映人类临床医生在疾病诊断中的推理过程?
  • RQ2通过基于提示的推理过程生成,是否能提升诊断性能,相较于标准分类方法?
  • RQ3蒸馏后的学生模型在临床环境中在多大程度上能复现大语言模型的推理与诊断准确性?
  • RQ4LLMs生成的推理过程在质量与临床相关性方面与人类专家相比如何?哪些标准可可靠评估其质量?
  • RQ5所提出的框架是否能在极少人工标注推理过程的前提下,有效应用于现实临床诊断任务?

主要发现

  • LLMs能够生成反映患者数据多步推理的临床相关推理过程,在误诊病例中仍有75%的推理过程保持医学正确。
  • 与标准分类基线相比,推理感知诊断框架显著提升了诊断性能,尤其在少样本设置下表现更优。
  • 蒸馏后的学生模型在保持推理透明性的同时实现了较高的诊断准确率,使其适用于临床环境中的高效部署。
  • 人工评估确认,生成的推理过程在逻辑上合理且与专家使用的临床推理模式一致。
  • 所提出的评估标准能有效区分高质量与低质量的推理过程,为可解释性临床AI的未来研究奠定基础。
  • 该框架证明,当提示得当时,LLMs具备临床推理能力,表明其在诊断决策支持中的广泛应用潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。