[论文解读] Aligning Large Language Models for Clinical Tasks
本文提出了一种名为 'expand-guess-refine' 的提示工程策略,用于对大型语言模型(LLMs)进行临床问答任务对齐,结合了检索增强生成与上下文提示技术。该方法在 USMLE 数据集上实现了 70.63% 的准确率,显著优于 ChatGPT 的 59.44%(p = 0.031),具有统计显著性。
Large Language Models (LLMs) have demonstrated remarkable adaptability, showcasing their capacity to excel in tasks for which they were not explicitly trained. However, despite their impressive natural language processing (NLP) capabilities, effective alignment of LLMs remains a crucial challenge when deploying them for specific clinical applications. The ability to generate responses with factually accurate content and to engage in non-trivial reasoning steps are crucial for the LLMs to be eligible for applications in clinical medicine. Employing a combination of techniques including instruction-tuning and in-prompt strategies like few-shot and chain-of-thought prompting has significantly enhanced the performance of LLMs. Our proposed alignment strategy for medical question-answering, known as 'expand-guess-refine', offers a parameter and data-efficient solution. A preliminary analysis of this method demonstrated outstanding performance, achieving a score of 70.63% on a subset of questions sourced from the USMLE dataset.
研究动机与目标
- 为解决大型语言模型(LLMs)在临床决策中实现可靠对齐的挑战,特别是在医学问答任务中的应用。
- 在无需大量微调的前提下,提升 LLM 在医学语境下的事实准确率与推理能力。
- 开发一种参数与数据高效对齐策略,提升性能的同时确保可解释性与可验证性。
- 评估检索增强提示是否能在高风险医学推理任务中超越标准零样本或微调 LLM。
- 证明非参数知识检索结合结构化提示可显著提升 LLM 在临床应用中的可靠性。
提出的方法
- expand-guess-refine 策略包含三个阶段:从向量数据库中检索生物医学知识,扩展输入上下文。
- 在 'Guess' 阶段,模型基于扩展后的上下文生成问题的答案,而无需查看答案选项。
- 在 'Refine' 阶段,模型通过逐步推理,从提供的选项中选择最佳答案,结合生成的猜测与检索到的证据。
- 该方法使用少样本提示与思维链(Chain-of-Thought, CoT)提示来引导推理,提升逻辑连贯性与准确性。
- 检索通过包含教科书章节的向量数据库完成,检索 top-k 文档以支撑模型输出。
- 该方法通过仅依赖上下文提示与检索增强,避免了微调,从而实现计算高效且易于适应。

实验结果
研究问题
- RQ1检索增强提示能否提升 LLM 在医学问答任务中的事实准确率与推理表现?
- RQ2expand-guess-refine 提示策略是否在临床问答基准上优于零样本与微调基线模型?
- RQ3在不进行微调的前提下,上下文提示技术(如思维链与少样本学习)能在多大程度上提升 LLM 的推理能力?
- RQ4一种参数高效、基于检索的对齐策略是否能在临床 LLM 应用中生成可解释且可验证的输出?
- RQ5与仅依赖参数化知识相比,非参数知识检索的整合如何影响 LLM 在 USMLE 数据集上的表现?
主要发现
- 在 USMLE 开发集前 100 个问题上,expand-guess-refine 策略实现了 70.63% 的测试准确率,显著优于 ChatGPT 的 59.44%(p = 0.031)。
- 该方法在基线模型上表现出统计显著的性能提升,表明其在临床推理任务中具有稳健性与可靠性。
- 检索增强提示提升了模型获取与利用外部医学知识的能力,增强了事实依据性。
- 在框架内使用思维链与少样本提示,提升了推理连贯性并减少了幻觉现象。
- 该方法无需微调即可实现高性能,使其在临床环境中具备可扩展性与高效性。
- 模型输出更具可解释性,因为推理步骤与证据来源可追溯至检索到的文档与内部逻辑。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。