[论文解读] Dr. Assistant: Enhancing Clinical Diagnostic Inquiry via Structured Diagnostic Reasoning Data and Reinforcement Learning
Dr. Assistant 引入一个临床诊断推理数据(CDRD)格式和一个两阶段的 SFT+RL 训练流程,以提升临床诊断推理能力和多轮问询,在与开源模型对比中表现出色,并在与 GPT-5 的对比中具备竞争力。
Clinical Decision Support Systems (CDSSs) provide reasoning and inquiry guidance for physicians, yet they face notable challenges, including high maintenance costs and low generalization capability. Recently, Large Language Models (LLMs) have been widely adopted in healthcare due to their extensive knowledge reserves, retrieval, and communication capabilities. While LLMs show promise and excel at medical benchmarks, their diagnostic reasoning and inquiry skills are constrained. To mitigate this issue, we propose (1) Clinical Diagnostic Reasoning Data (CDRD) structure to capture abstract clinical reasoning logic, and a pipeline for its construction, and (2) the Dr. Assistant, a clinical diagnostic model equipped with clinical reasoning and inquiry skills. Its training involves a two-stage process: SFT, followed by RL with a tailored reward function. We also introduce a benchmark to evaluate both diagnostic reasoning and inquiry. Our experiments demonstrate that the Dr. Assistant outperforms open-source models and achieves competitive performance to closed-source models, providing an effective solution for clinical diagnostic inquiry guidance.
研究动机与目标
- 通过结构化数据格式(CDRD)捕捉抽象的临床诊断推理逻辑。
- 开发一个两阶段训练流程(SFT 再 RL),以建立诊断推理与问询技能。
- 为 CDSS 情境下评估诊断推理与临床问询创建一个基准。
- 证明 Dr. Assistant 在基准上优于开源模型并且接近闭源模型的表现。
提出的方法
- 将 CDRD 定义为三元组(S, E, D),代表核心症状、诊断证据与鉴别诊断。
- 构建一个三阶段管线,从临床指南中结合LLM合成与医生 refinement 构建 CDRD。
- 通过回答形成与问题生成,从 CDRD 中生成用于监督微调(SFT)的 QA 数据。
- 通过双主体(医生与患者)的基于 CDRD 与患者画像的对话,生成用于 RL 的多轮问询数据。
- 在 P_SFT 上对 Dr. Assistant 进行 SFT 训练,随后使用一个综合奖励(包含临床推理、问询与对 CDRD 的忠实度 R_div 与 R_comp)进行 RL。
- 使用一个基于 ICD-10 的专用推理基准,包含 242 个患者画像和 147 轮问询进行评估。
实验结果
研究问题
- RQ1结构化诊断推理数据格式(CDRD)是否能改善与临床指南的一致性相关的抽象推理?
- RQ2相较于基线模型,两阶段的 SFT+RL 训练是否能提升诊断问询质量和推理忠实度?
- RQ3在动态诊断推理和问询基准上,Dr. Assistant 相对于开源和闭源大型语言模型的表现如何?
- RQ4对 CDRD 的忠实性惩罚对输出质量和临床推断安全性有何影响?
主要发现
- Dr. Assistant 在评估的模型中实现了最高的 ICD-Recall,超过若干开源医疗模型,接近闭源 GPT-5 的表现。
- 在 ICD-Recall 基准测试中,Dr. Assistant 相比 HuatuoGPT-o1-72B 的提升约为 13.59%。
- Dr. Assistant 在 ICD-Recall 指标上展现出与若干开源模型竞争甚至优于某些模型,并接近 GPT-5。
- 医生评估者反映 Dr. Assistant 的问询质量更高,相较于开源基线有显著改进,特别是相比 Med42-v2-8B 与 HuatuoGPT-o1-72B。
- 消融研究表明 SFT 与 RL 均有显著贡献,RL 提供了最大的相对性能提升;R_div 保真度项也显著提升输出质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。