Skip to main content
QUICK REVIEW

[论文解读] MedDialog: A Large-scale Medical Dialogue Dataset

Shu Chen, Zeqian Ju|arXiv (Cornell University)|Apr 7, 2020
Machine Learning in Healthcare参考文献 2被引用 28
一句话总结

本文介绍了 MedDialog,这是一个大规模的医疗对话数据集,包含 0.3 百万条英文和 1.1 百万条中文患者-医生对话,分别对应 0.5 百万条和 4 百万条话语。这是迄今为止最大的医疗对话数据集,旨在推动远程医疗应用中医疗对话系统的研究。

ABSTRACT

Medical dialogue systems are promising in assisting in telemedicine to increase access to healthcare services, improve the quality of patient care, and reduce medical costs. To facilitate the research and development of medical dialogue systems, we build two large-scale medical dialogue datasets: MedDialog-EN and MedDialog-CN. MedDialog-EN is an English dataset containing 0.3 million conversations between patients and doctors and 0.5 million utterances. MedDialog-CN is an Chinese dataset containing 1.1 million conversations and 4 million utterances. To our best knowledge, MedDialog-(EN,CN) are the largest medical dialogue datasets to date. The dataset is available at this https URL

研究动机与目标

  • 为解决缺乏大规模、多样化医疗对话数据集以用于训练和评估医疗对话系统的问题。
  • 通过可扩展的、数据驱动的医疗对话系统,提升远程医疗中的医疗可及性。
  • 通过提供并行的英汉医疗对话数据,支持多语言研究。
  • 促进开发准确且具备上下文感知能力的医疗对话代理,以改善患者护理。

提出的方法

  • 从真实世界的医疗咨询数据中整理并构建了 MedDialog-EN 和 MedDialog-CN。
  • 从远程医疗平台收集患者-医生对话,确保其临床相关性和多样性。
  • 将数据标注并结构化为逐轮对话格式,以支持模型训练与评估。
  • 通过专家评审和语言学验证确保数据质量,以维持医疗准确性。
  • 标准化对话格式和元数据,以实现与现有 NLP 和对话系统框架的互操作性。
  • 通过专用 URL 公开发布数据集,以支持广泛的研究访问和可复现性。

实验结果

研究问题

  • RQ1大规模、多语言的医疗对话数据集是否能提升医疗对话系统在真实远程医疗环境中的性能?
  • RQ2对话数据的规模和多样性在多大程度上影响上下文感知型医疗对话代理的训练?
  • RQ3多语言医疗对话数据集在多大程度上能够支持跨语言医疗对话模型的开发?
  • RQ4在大规模收集和整理临床准确的医疗对话数据时,面临的主要挑战是什么?

主要发现

  • MedDialog-EN 包含 0.3 百万条英文对话和 0.5 百万条话语,是目前公开可用的最大规模英文医疗对话数据集之一。
  • MedDialog-CN 包含 1.1 百万条中文对话和 4 百万条话语,显著扩展了中文医疗对话数据的规模。
  • 合并后的数据集在英文和中文中均为迄今为止最大的医疗对话数据集合。
  • 数据集已通过专用 URL 公开发布,以支持医疗对话系统领域的开放研究和可复现性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。