[논문 리뷰] Emulating Clinician Cognition via Self-Evolving Deep Clinical Research
DxEvolve는 심층 임상 연구 워크플로를 통해 만남을 재사용 가능한 진단 인지 원시(primitives)로 전환하는 자기 진화 진단 에이전트로, 임상의 수준의 정확도와 기관 간 이식성을 파라미터 재훈련 없이 달성합니다.
Clinical diagnosis is a complex cognitive process, grounded in dynamic cue acquisition and continuous expertise accumulation. Yet most current artificial intelligence (AI) systems are misaligned with this reality, treating diagnosis as single-pass retrospective prediction while lacking auditable mechanisms for governed improvement. We developed DxEvolve, a self-evolving diagnostic agent that bridges these gaps through an interactive deep clinical research workflow. The framework autonomously requisitions examinations and continually externalizes clinical experience from increasing encounter exposure as diagnostic cognition primitives. On the MIMIC-CDM benchmark, DxEvolve improved diagnostic accuracy by 11.2% on average over backbone models and reached 90.4% on a reader-study subset, comparable to the clinician reference (88.8%). DxEvolve improved accuracy on an independent external cohort by 10.2% (categories covered by the source cohort) and 17.1% (uncovered categories) compared to the competitive method. By transforming experience into a governable learning asset, DxEvolve supports an accountable pathway for the continual evolution of clinical AI.
연구 동기 및 목표
- Static AI 진단과 동적 임상 추론 사이의 차이점과 감사 가능한 거버넌스의 중요성에 대한 동기를 부여합니다.
- 임상 encounters를 통해 노출된 경험 아티팩트를 통해 진화하는 워크플로우 정렬 진단 에이전트를 제안합니다.
- 학습된 진단 휴리스틱의 교차기관 및 교차언어 이식 가능성을 DCP를 통해 제공합니다.
- 공개 벤치마크 및 외부 코호트에서 진단 정확도 및 임상의 수준의 성능 향상을 시연합니다.
- 임상 AI의 지속적 개선을 위한 감사 가능한 거버넌스 친화적 경로를 제공합니다.
제안 방법
- DxEvolve를 소개합니다. 증거 획득과 가설 정제를 안내하는 대화형 깊은 임상 연구(DCR) 워크플로우입니다.
- 증거 중심 추론 루프 내에서 검사, 혈액 검사, 영상 및 외부 소스(가이드라인, PubMed) 탐색을 경량으로 통합합니다.
- 임상 경험의 trajectories를 진단 인지 원시(DCP)로 증류합니다. 이는 재사용 가능하고 색인화 가능한 임상 경험 저장소입니다.
- 고정 누적 풀을 가진 MIMIC-CDM에서 DxEvolve를 평가하고 CDM 기준선 및 비-DCP 애벌레이션과 비교합니다.
- 번역된 기록과 원어 기록을 사용한 중국 인민해방군 합병병원 코호트에 대해 외부 검증으로 이식 가능성을 확인합니다.
실험 결과
연구 질문
- RQ1워크플로우 정렬 진단 에이전트가 인터랙티브한 증거 획득 제약 하에서 임상의 수준의 정확성을 달성할 수 있는가?
- RQ2진단 인지 원시(DCP)가 기관 간 및 언어 간에 감사 가능하고 거버너블하며 이전 가능 학습을 가능하게 하는가?
- RQ3encounter 노출이 증가하고 오류가 학습을 촉진함에 따라 자기 진화가 진단 성능에 어떤 영향을 미치는가?
- RQ4가이드라인 및 PubMed 데이터의 외부 검색이 필수적인가, 아니면 핵심 워크플로우 골격과 DCP들로도 성과 향상이 가능한가?
- RQ5DxEvolve의 경험 학습의 교차기관적 및 교차언어 일반화 가능성은 어느 정도인가?
주요 결과
- DxEvolve는 MIMIC-CDM에서 기본 LLM 백본들에 대해 CDM 기준선 대비 평균 정확도 11.2%의 이득을 제공합니다.
- DxEvolve는 독해자 연구 하위 집합에서 90.4%의 정확도에 도달하여 인간 전문가 벤치마크인 88.8%를 상회합니다.
- 외부 중국 코호트에서 CDM 기준선 대비 10.2%의 이득을 보이고, 초기 저장소에 없던 범주에서 17.1%의 이득이 나타납니다.
- DCP 가이드 자기 진화는 번역 및 기관 간 전이 가능한 도메인-비의존적 휴리스틱을 제공하며(중국어 문서 포함)
- 후기 단계 DCP들은 임상의 평가 점수가 더 높고 오류 수정 에피소드에서 더 자주 검색되어 경험 아티팩트의 성숙을 나타냅니다.
- DxEvolve는 증거 수집에서의 워크플로우 일관성과 가이드라인 준수를 향상시켜 기준선 대비 성과를 높입니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.