[論文レビュー] Dr. Assistant: Enhancing Clinical Diagnostic Inquiry via Structured Diagnostic Reasoning Data and Reinforcement Learning
Dr. Assistant は Clinical Diagnostic Reasoning Data (CDRD) 形式と二段階の SFT+RL 学習パイプラインを導入し、臨床診断推論と多ターン問合せを改善。オープンソースモデルと比較して強力なパフォーマンスを発揮し、GPT-5 と競合する結果を達成。
Clinical Decision Support Systems (CDSSs) provide reasoning and inquiry guidance for physicians, yet they face notable challenges, including high maintenance costs and low generalization capability. Recently, Large Language Models (LLMs) have been widely adopted in healthcare due to their extensive knowledge reserves, retrieval, and communication capabilities. While LLMs show promise and excel at medical benchmarks, their diagnostic reasoning and inquiry skills are constrained. To mitigate this issue, we propose (1) Clinical Diagnostic Reasoning Data (CDRD) structure to capture abstract clinical reasoning logic, and a pipeline for its construction, and (2) the Dr. Assistant, a clinical diagnostic model equipped with clinical reasoning and inquiry skills. Its training involves a two-stage process: SFT, followed by RL with a tailored reward function. We also introduce a benchmark to evaluate both diagnostic reasoning and inquiry. Our experiments demonstrate that the Dr. Assistant outperforms open-source models and achieves competitive performance to closed-source models, providing an effective solution for clinical diagnostic inquiry guidance.
研究の動機と目的
- 構造化データ形式(CDRD)を介して抽象的な臨床診断推論ロジックを捉える。
- 診断推論と問合せスキルを構築する二段階のトレーニングパイプライン(SFT→RL)を開発する。
- CDSS 文脈での診断推論と臨床問合せを評価するベンチマークを作成する。
- Dr. Assistant がオープンソースモデルを上回り、ベンチマーク上でクローズドソースモデルに匹敵することを示す。)
提案手法
- CDRD を中核症状、診断根拠、鑑別診断を表す三要素タプル(S, E, D)として定義する。
- 臨床ガイドラインから CDRD を構築するための三段階パイプラインを、LLM の合成と医師による refine を用いて構築する。
- 回答の作成と質問の合成を通じて CD RD から教師ありファインチューニング(SFT)用の QA データを生成する。
- CDRD と患者プロファイルに基づく医師と患者の二-agent 対話を通じて RL 用の多ターン問合せデータを作成する。
- SFT を P_SFT で学習した後、臨床推論・問合せ・CDRD への忠実性を含む複合報酬(R_div および R_comp)を用いた RL で Dr. Assistant を訓練する。
- 242 の患者プロファイルと 147 回の問合せラウンドを含む ICD-10 ベースの推論ベンチマークを用いて評価する。)
実験結果
リサーチクエスチョン
- RQ1構造化診断推論データ形式(CDRD)は臨床ガイドラインとの抽象的推論整合を改善できるか?
- RQ2二段階の SFT+RL トレーニングは基準モデルと比較して診断問合せ品質と推論忠実度を高めるか?
- RQ3Dr. Assistant はオープンソースおよびクローズドソース LLM と比較して動的な診断推論と問合せベンチマークでどの程度パフォーマンスを示すか?
- RQ4CDRD への忠実性ペナルティの影響は、出力品質と臨床推論の安全性にどう影響するか?
主な発見
- Dr. Assistant は評価対象モデルの中で最も高い ICD-Recall を達成し、複数のオープンソース医療モデルを上回り、GPT-5 のパフォーマンスに近づいた。
- ICD-Recall ベンチマークで、Dr. Assistant は HuatuoGPT-o1-72B に対して約 13.59% の相対的改善を示した。
- Dr. Assistant は複数のオープンソースモデルと競合する、または GPT-5 に近づく ICD-Recall 指標の結果を示した。
- 医師評価者は Dr. Assistant の問合せに対する満足度がオープンソースのベースラインより高く、Med42-v2-8B および HuatuoGPT-o1-72B に対して顕著な改善を報告した。
- アブレーション研究は SFT と RL の双方が実質的に寄与しており、 RL が相対的な性能向上に最も寄与することを示している。R_div 忠実性項も出力品質を意味的に改善する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。