Skip to main content
QUICK REVIEW

[论文解读] Emulating Clinician Cognition via Self-Evolving Deep Clinical Research

Ruiyang Ren, Yuhao Wang|arXiv (Cornell University)|Mar 11, 2026
Artificial Intelligence in Healthcare and Education被引用 0
一句话总结

DxEvolve 是一个自我进化的诊断代理,利用深度临床研究工作流将就诊转化为可重复使用的诊断认知原语,在跨机构实现临床医生级别的准确性和可移植性,无需参数化再训练。

ABSTRACT

Clinical diagnosis is a complex cognitive process, grounded in dynamic cue acquisition and continuous expertise accumulation. Yet most current artificial intelligence (AI) systems are misaligned with this reality, treating diagnosis as single-pass retrospective prediction while lacking auditable mechanisms for governed improvement. We developed DxEvolve, a self-evolving diagnostic agent that bridges these gaps through an interactive deep clinical research workflow. The framework autonomously requisitions examinations and continually externalizes clinical experience from increasing encounter exposure as diagnostic cognition primitives. On the MIMIC-CDM benchmark, DxEvolve improved diagnostic accuracy by 11.2% on average over backbone models and reached 90.4% on a reader-study subset, comparable to the clinician reference (88.8%). DxEvolve improved accuracy on an independent external cohort by 10.2% (categories covered by the source cohort) and 17.1% (uncovered categories) compared to the competitive method. By transforming experience into a governable learning asset, DxEvolve supports an accountable pathway for the continual evolution of clinical AI.

研究动机与目标

  • 通过可审计治理来激发静态AI诊断与动态临床推理之间的差距。
  • 提出一个与工作流对齐的诊断代理,从临床就诊中通过暴露的经验伪物进化。
  • 通过DCP实现跨机构和跨语言可移植的学习诊断启发式。
  • 在公开基准和外部队列上证明诊断准确性和临床医生级别的提升。
  • 为临床AI的持续改进提供可审计、治理友好的路径。

提出的方法

  • 引入 DxEvolve,一个交互式深度临床研究(DCR)工作流,指导证据获取与假设精炼。
  • 在证据中心推理循环中,轻量化地整合检查、化验、影像以及外部来源(指南、PubMed)的探索。
  • 将就诊轨迹提炼为诊断认知原语(DCPs),这是一组可复用、可索引的临床经验库。
  • 在具有固定累积池的 MIMIC-CDM 上评估 DxEvolve,与 CDM 基线和非 DCP 消融进行比较。
  • 使用翻译与本地记录对中国人民解放军总医院队列进行外部验证以验证可移植性。

实验结果

研究问题

  • RQ1在可交互证据获取约束下,工作流对齐的诊断代理是否能实现临床医生级别的准确性?
  • RQ2诊断认知原语是否能够实现可审计、可治理、跨机构和跨语言的可转移学习?
  • RQ3随着就诊暴露增加与错误驱动学习,自我进化如何影响诊断性能?
  • RQ4外部检索指南和 PubMed 数据是否必要,还是核心工作流支架与 DCPs 就足以带来提升?
  • RQ5DxEvolve 的经验学习在跨机构与跨语言上的普适性如何?

主要发现

  • DxEvolve 在 MIMIC-CDM 的基线 CDM 上对基础大模型骨架实现了 11.2% 的平均准确性提升。
  • DxEvolve 在阅片研究子集上达到 90.4% 的准确性,超过人类专家基准 88.8%。
  • 外部验证在外部中国队列上相较 CDM 基线提升 10.2%,在初始知识库中缺失的类别中提升 17.1%。
  • 在翻译与不同机构之间,DCP 指导的自我进化提供了可移植、领域无关的启发式方法。
  • 后期阶段的 DCP 获得更高的临床医生评分,并在纠错情节中被更频繁检索,表明经验伪物的成熟。
  • DxEvolve 在证据获取中提升了工作流一致性与指南依从性,相较基线有所改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。