Skip to main content
QUICK REVIEW

[论文解读] Few shot chain-of-thought driven reasoning to prompt LLMs for open ended medical question answering

Saeel Sandeep Nachane, Ojas Gramopadhye|arXiv (Cornell University)|Mar 7, 2024
Topic Modeling被引用 4
一句话总结

本文提出了一种新颖的少样本思维链(CoT)提示方法——渐进式推理,专为使用大语言模型(LLMs)进行开放式医学问答而设计。通过模仿真实临床推理过程,并整合由人类验证的奖励模型以验证响应,该方法显著优于标准CoT提示,在使用Llama2-7B模型对100道题进行评估时,推理质量和准确性的专家一致性达到86%。

ABSTRACT

In this paper, we propose a modified version of the MedQA-USMLE dataset, named MEDQA-OPEN, which contains open-ended medical questions without options to mimic clinical scenarios, along with clinician-approved reasoned answers. Additionally, we implement a prompt driven by Chain of Thought (CoT) reasoning, CLINICR, to mirror the prospective process of incremental reasoning, reaching a correct response to medical questions. We empirically demonstrate how CLINICR outperforms the state-of-the-art 5-shot CoT-based prompt (Liévin et al., 2022). We also present an approach that mirrors real-life clinical practice by first exploring multiple differential diagnoses through MCQ-CLINICR and subsequently narrowing down to a final diagnosis using MCQ-ELIMINATIVE. Finally, emphasizing the importance of response verification in medical settings, we utilize a reward model mechanism, replacing the elimination process performed by MCQ-ELIMINATIVE.

研究动机与目标

  • 为填补现有医学问答数据集中主要为多选题的空白,创建一个去除选项的修改版MedQA-USMLE数据集,以支持开放式推理。
  • 开发一种提示策略,通过逐步、渐进的推理方式模拟真实临床决策过程,而非单步CoT。
  • 通过在人类评估的推理-答案对上训练奖励模型,以区分高质量与低质量响应,从而提升医学大语言模型响应的可验证性。
  • 评估渐进式推理提示与基于验证器的响应选择策略相对于基线提示方法(如Codex CoT和提示链)的有效性。

提出的方法

  • 通过移除原始MedQA-USMLE数据集中的答案选项,以支持开放式响应生成,创建了一个新数据集,称为MedQA-No-Opt。
  • 设计了一种渐进式推理提示,引导大语言模型生成逐步推进、面向未来的临床推理,以模拟真实的诊断工作流程。
  • 使用Llama2-7b-chat模型并应用渐进式推理模板生成推理轨迹,随后由医学专家进行验证。
  • 采用成对偏好学习构建奖励模型:基于同一问题的正样本(正确)和负样本(错误)响应-推理对,奖励边际设为0.4。
  • 使用LoRA微调Llama2-7b-chat模型进行奖励建模,损失函数为:$\mathcal{L}^{rw} = -\log(\sigma(r_{\boldsymbol{\phi}}(q_i, o^{c}_i) - r_{\boldsymbol{\phi}}(q_i, o^{r}_i) - m(r)))$。
  • 使用训练好的奖励模型从MedCodex少样本提示生成的四个选项中选择得分最高的响应,实现基于验证器的响应选择。
Figure 1: Forward and Eliminative prompting strategies overview
Figure 1: Forward and Eliminative prompting strategies overview

实验结果

研究问题

  • RQ1与标准少样本CoT提示相比,渐进式推理提示是否能提升大语言模型在开放式医学问答中生成响应的质量和准确性?
  • RQ2在人类验证的推理-答案对上训练的奖励模型,在多大程度上能提升医学大语言模型对高质量响应的选择能力?
  • RQ3基于验证器的响应选择策略是否优于传统提示方法(如提示链和排除推理)在临床推理任务中的表现?
  • RQ4渐进式推理方法在不同参数规模的大语言模型上表现如何,特别是在较小模型(如Llama2-7B)上的表现如何?
  • RQ5在模型未在医学数据上进行微调的情况下,基于推理质量训练的奖励模型是否能有效引导大语言模型选择准确答案?

主要发现

  • 在使用Llama2-7B模型对MedQA-No-Opt数据集进行的100道题评估中,渐进式推理提示在推理质量和最终答案准确性方面达到了86%的专家一致性。
  • 基于验证器的响应选择策略在选择准确且可解释的响应方面,显著优于基线提示方法,包括提示链和排除推理。
  • 在需要多步诊断推理的特定临床推理场景中,渐进式推理方法优于修改后的5-shot-Codex-CoT提示。
  • 使用贪婪解码的渐进式推理方法优于其他解码策略,表明其在生成连贯推理时具有更强的鲁棒性和可靠性。
  • 在人类验证的推理对上训练的奖励模型在区分正确与错误响应方面表现出强大能力,医学专家即使在答案正确的情况下也能可靠识别推理中的缺陷。
  • 该方法展现出通过改进提示和验证机制,可超越更大模型的潜力,表明先进的提示设计与验证机制可弥补模型规模的局限。
Figure 2: Codex COT looks at generating options in a more eliminative approach, often not catering to the context of clinical investigation, unlike differential diagnostics as per MedCodex
Figure 2: Codex COT looks at generating options in a more eliminative approach, often not catering to the context of clinical investigation, unlike differential diagnostics as per MedCodex

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。