[論文レビュー] MedDialog: Two Large-scale Medical Dialogue Datasets
本稿では、0.3百万件の英語および1.1百万件の中国語の患者-医師対話から構成される大規模な医療対話データセット、MedDialog-EN および MedDialog-CN を紹介する。それぞれ 0.5 百万件および 4 百万件の発話が含まれる。実際のテレメディスンプラットフォームから収集されたもので、96 および 172 の医学的専門分野をカバーしており、テレメディスン応用分野におけるAI駆動の医療対話システムの発展に多様で高品質な訓練データを提供する。
Medical dialogue systems are promising in assisting in telemedicine to increase access to healthcare services, improve the quality of patient care, and reduce medical costs. To facilitate the research and development of medical dialogue systems, we build two large-scale medical dialogue datasets: MedDialog-EN and MedDialog-CN. MedDialog-EN is an English dataset containing 0.3 million conversations between patients and doctors and 0.5 million utterances. MedDialog-CN is an Chinese dataset containing 1.1 million conversations and 4 million utterances. To our best knowledge, MedDialog-(EN,CN) are the largest medical dialogue datasets to date. The dataset is available at https://github.com/UCSD-AI4H/Medical-Dialogue-System
研究の動機と目的
- AI駆動の医療対話システムを訓練するための、大規模で多様かつ代表的な医療対話データセットの不足に対処すること。
- 既存のデータセットがサイズが小さく、特定の疾患に偏っている、または単一言語に限定されているという制限を克服すること。
- 複数の医学的専門分野および患者の人口統計的特性をカバーする、医師レベルの知能を備えた医療対話システムの開発を可能にすること。
- 公開可能な高品質なデータを提供することで、多言語および多専門分野の医療対話AI分野の研究を支援すること。
- 仮想医師が遠隔での患者診察、モニタリング、介入を支援できるようにすることで、テレメディスン分野の進歩を促進すること。
提案手法
- 国際的なテレメディスンプラットフォーム iCliniq.com(英語)および Haodf.com(中国語)から、実際の患者-医師対話をクロールした。
- 患者の医学的履歴、症状記述、対話のターン、臨床的助言を含む構造化されたデータを収集した。
- ノイズを低減し、一貫性を向上させるために、同じ発話者からの連続発話を統合して対話の前処理を行った。
- 2つの異なるデータセットにデータを整理した:MedDialog-EN(257,454 件の英語対話、514,908 発話)および MedDialog-CN(1,145,231 件の中国語対話、3,959,333 発話)。
- MedDialog-EN に 96 の専門分野、MedDialog-CN に 172 の細分化された専門分野を含めることで、広範な医学的専門分野カバレッジを確保した。
- 前処理段階で個人を特定できる情報を削除することで、データの機微性と匿名性を維持した。
実験結果
リサーチクエスチョン
- RQ1大規模で多様かつ多言語の医療対話データセットは、医療対話システムのパフォーマンスと一般化能力を顕著に向上させることができるか?
- RQ2既存の医療対話データセットは、医学的専門分野および患者の多様性の全範囲をどれほど適切に反映していないか?
- RQ3大規模なデータセットは、さまざまな医学的状態において、複雑で複数ターンの対話を処理できる医療対話モデルの能力をどの程度高めるか?
- RQ4多言語および多民族のデータは、AI駆動の医療対話エージェントの頑健性と公平性にどのような影響を与えるか?
- RQ5MedDialog のような公開可能な大規模データセットは、テレメディスンおよびバーチャルヘルスアシスタント分野における研究開発を加速させることができるか?
主な発見
- MedDialog-EN は、これまでで最大の英語医療対話データセットであり、257,454 件の患者-医師対話と 514,908 発話を含む。
- MedDialog-CN は、これまでで最大の中国語医療対話データセットであり、1,145,231 件の対話と 3,959,333 発話を含み、172 の細分化された医学的専門分野をカバーする。
- データセットは、循環器疾患、腎臓疾患、がん、家族医学など、幅広い医学的専門分野をカバーしており、包括的なカバレッジを確保している。
- 両方のデータセットの患者は、中国の31の省レベル行政区画および世界の地域にまたがる多様な人口統計的背景を有しており、母集団バイアスを最小限に抑える。
- データセットは https://github.com/UCSD-AI4H/Medical-Dialogue-System で公開されており、オープンな研究と再現可能な開発を可能にしている。
- MedDialog-EN および MedDialog-CN は、既存のデータセットよりも顕著に大規模であり、同じ発話者からのシーケンスを統合した場合、MedDialog-CN は 340 万発話以上にのぼり、既存のベンチマークをはるかに上回っている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。