Skip to main content
QUICK REVIEW

[論文レビュー] DDXPlus: A New Dataset For Automatic Medical Diagnosis

Arsène Fansi Tchango, Rishab Goel|arXiv (Cornell University)|May 18, 2022
Machine Learning in Healthcare被引用数 8
ひとこと要約

DDXPlusは、130万件の患者を含む大規模な合成データセットを提供し、構造化された医療歴(バイナリ、カテゴリカル、マルチチョイスの症状・原因疾患)に加え、真の病態と鑑別診断の両方を含む。本研究では、自動診断および症状検出システムを鑑別診断で訓練することで、臨床的推論の効率性とモデルの解釈可能性が著しく向上することを示しており、真の病態のみで訓練されたモデルを上回る性能を発揮した。

ABSTRACT

There has been a rapidly growing interest in Automatic Symptom Detection (ASD) and Automatic Diagnosis (AD) systems in the machine learning research literature, aiming to assist doctors in telemedicine services. These systems are designed to interact with patients, collect evidence about their symptoms and relevant antecedents, and possibly make predictions about the underlying diseases. Doctors would review the interactions, including the evidence and the predictions, collect if necessary additional information from patients, before deciding on next steps. Despite recent progress in this area, an important piece of doctors' interactions with patients is missing in the design of these systems, namely the differential diagnosis. Its absence is largely due to the lack of datasets that include such information for models to train on. In this work, we present a large-scale synthetic dataset of roughly 1.3 million patients that includes a differential diagnosis, along with the ground truth pathology, symptoms and antecedents for each patient. Unlike existing datasets which only contain binary symptoms and antecedents, this dataset also contains categorical and multi-choice symptoms and antecedents useful for efficient data collection. Moreover, some symptoms are organized in a hierarchy, making it possible to design systems able to interact with patients in a logical way. As a proof-of-concept, we extend two existing AD and ASD systems to incorporate the differential diagnosis, and provide empirical evidence that using differentials as training signals is essential for the efficiency of such systems or for helping doctors better understand the reasoning of those systems.

研究の動機と目的

  • 医療AI研究において、鑑別診断を含む大規模データセットの不足に対処すること。
  • 鑑別診断を訓練信号として取り入れることで、自動診断(AD)および自動症状検出(ASD)システムの効率性と解釈可能性を向上させること。
  • AI駆動の患者対話において、より臨床的に現実的で階層的かつマルチモーダルなデータ収集を可能にすること。
  • 臨床的推論プロセスを反映した、AD/ASDシステムの訓練および評価のためのベンチマークを提供すること。
  • 鑑別診断を用いて診断の不確実性をモデル化することで、信頼性が高く医師が監査可能なAIシステムの開発を支援すること。

提案手法

  • 臨床的妥当性を確保するため、特許取得済みの医療知識ベースと商用のADシステムを用いて、合成的にデータセットを生成した。
  • 49の病態、110の症状、113の原因疾患を含み、症状および原因疾患は、バイナリ、カテゴリカル、マルチチョイスの3種類に分類され、効率的なデータ収集を可能にした。
  • 症状は階層的構造に整理されており、AIエージェントにおける論理的で段階的な質問の実装を支援する。
  • 各患者に対して鑑別診断が生成され、症状および原因疾患に基づく妥当な疾患リストを反映しており、臨床的推論を模倣している。
  • 既存の2つのAD/ASDシステム(AARLCおよびBASD)を拡張し、訓練中に鑑別診断信号を統合した。
  • モデルの性能は、証拠収集の完全性、鑑別診断の質、臨床的推論との整合性に基づいて評価された。

実験結果

リサーチクエスチョン

  • RQ1鑑別診断で訓練したADおよびASDシステムは、証拠収集の質および完全性を向上させることができるか?
  • RQ2鑑別診断を訓練信号として組み込むことで、モデルの解釈可能性および臨床ワークフローとの整合性はどのように変化するか?
  • RQ3階層的およびマルチチョイスの症状を用いることで、AI駆動の医療面接における症状収集の効率は向上するか?
  • RQ4鑑別診断で訓練したモデルと真の病態のみで訓練したモデルとを比較した場合、診断的推論およびカバレッジの観点でどちらが優れているか?
  • RQ5鑑別診断を備えた合成データセットは、臨床的AIシステムの発展を促進する有効なベンチマークとして機能するか?

主な発見

  • 鑑別診断で訓練したモデル(例:BASD)は、真の病態のみで訓練したモデルに比べ、より包括的かつ臨床的に関連性の高い鑑別診断を生成した。
  • 鑑別診断信号を用いて訓練したAARLCモデルは、より広範な証拠収集と多数の潜在的病態の探索を実現し、診断カバレッジが向上した。
  • 真の病態のみで訓練したAARLCモデルは、不完全な鑑別診断を提示し、質問数も少なかったため、診断の信頼性が制限された。
  • 鑑別診断で訓練したBASDモデルは十分な証拠収集が可能であったが、特異性に欠け、併用訓練信号の必要性を示唆した。
  • 鑑別診断と真の病態の両方を用いた統合的訓練が、証拠収集における包括性と特異性の両立を達成し、最も優れた結果をもたらした。
  • 本研究は、鑑別診断が、効率的で信頼性が高く臨床的整合性のある医療診断AIシステムを構築するために不可欠であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。