[论文解读] On the Generation of Medical Dialogues for COVID-19
本文介绍了CovidDialog,一个用于COVID-19咨询的英汉双语医学对话数据集,并利用预训练的Transformer、GPT以及BERT-GPT架构微调了对话生成模型。这些模型在生成类医生风格、相关且具有临床信息量的回复方面表现出色,证明了在大流行期间采用人工智能驱动的虚拟医疗咨询的可行性。
Under the pandemic of COVID-19, people experiencing COVID19-related symptoms or exposed to risk factors have a pressing need to consult doctors. Due to hospital closure, a lot of consulting services have been moved online. Because of the shortage of medical professionals, many people cannot receive online consultations timely. To address this problem, we aim to develop a medical dialogue system that can provide COVID19-related consultations. We collected two dialogue datasets -- CovidDialog -- (in English and Chinese respectively) containing conversations between doctors and patients about COVID-19. On these two datasets, we train several dialogue generation models based on Transformer, GPT, and BERT-GPT. Since the two COVID-19 dialogue datasets are small in size, which bear high risk of overfitting, we leverage transfer learning to mitigate data deficiency. Specifically, we take the pretrained models of Transformer, GPT, and BERT-GPT on dialog datasets and other large-scale texts, then finetune them on our CovidDialog tasks. We perform both automatic and human evaluation of responses generated by these models. The results show that the generated responses are promising in being doctor-like, relevant to the conversation history, and clinically informative. The data and code are available at https://github.com/UCSD-AI4H/COVID-Dialogue.
研究动机与目标
- 为应对COVID-19大流行期间医疗专业人员严重短缺的问题,开发基于人工智能的虚拟医生以支持在线咨询。
- 收集并发布两个高质量的多语言医学对话数据集——CovidDialog-English和CovidDialog-Chinese,包含真实的患者-医生关于COVID-19的对话。
- 在这些数据集上使用迁移学习训练并评估对话生成模型,以缓解数据稀缺和过拟合问题。
- 通过自动指标和人工评估相结合的方式,评估生成回复的质量,重点关注相关性、临床信息量和语言流畅性。
- 展示微调的大语言模型在生成与疫情相关的健康咨询中具有医学准确性且上下文恰当的回复方面的潜力。
提出的方法
- 从在线医疗论坛(包括icliniq.com、healthcaremagic.com和healthtap.com)收集了603份英文和1,088份中文咨询对话,构建CovidDialog数据集。
- 在大规模对话和文本语料上预训练Transformer、GPT和BERT-GPT模型,随后在CovidDialog数据集上进行微调,以减少过拟合。
- 通过迁移学习方法,使用在大规模对话和通用文本上预训练的权重初始化模型,随后在医学对话数据上进行微调。
- 使用束搜索解码(k=50)生成回复,并采用自动指标(包括困惑度、BLEU-2/4、METEOR、NIST-4、熵以及多样性(Dist-1/2))评估模型性能。
- 在100个随机抽取的中文测试样本上,由五名标注员进行人工评估,评分标准包括相关性、临床信息量和流畅性。
- 比较了多种架构:标准Transformer、DialoGPT、BERT-GPT及其带有最大互信息(MMI)正则化的变体。
实验结果
研究问题
- RQ1在小规模医学对话数据集上微调的预训练语言模型,能否生成既具有医学准确性又语言流畅的回复?
- RQ2从大规模预训练中迁移学习,在低资源医学对话设置下如何提升回复质量?
- RQ3在生成具有临床相关性的回复方面,不同架构类型(仅解码器结构的GPT、编码器-解码器结构的BERT-GPT,以及标准Transformer)的相对性能如何?
- RQ4在医学对话生成中,自动指标与人工判断的回复质量之间是否存在相关性?
- RQ5在低资源、噪声大或领域分布偏移的语言(如中文医学对话)中应用此类模型时,会面临哪些挑战?
主要发现
- BERT-GPT在响应多样性方面表现最佳,其Dist-1和Dist-2得分表明输出更具变化性且重复性更低。
- 如DialoGPT和BERT-GPT等预训练模型相比未预训练的Transformer,困惑度显著更低,证实了在低数据环境下迁移学习的有效性。
- 人工评估显示,BERT-GPT生成的回复在相关性、临床信息量和流畅性方面评分高于其他模型,尽管仍低于人类参考标准。
- 尽管DialoGPT在对话数据上进行了预训练,但在中文任务中表现不如未预训练的Transformer,可能是因为从通用对话到医学咨询存在领域偏移。
- BERT-GPT与人类参考之间的性能差距在中文中大于英文,表明在处理嘈杂、语法错误或语义模糊的中文医学对话时面临更大挑战。
- 最大互信息(MMI)正则化并未持续提升回复质量,表明在此特定医学对话设置中收益有限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。