[论文解读] A Tailored Pre-Training Model for Task-Oriented Dialog Generation
该论文提出PRAL,一种专为任务导向对话生成设计的预训练角色交替语言模型,采用独立的GPT-2编码器分别建模用户与系统角色,结合知识蒸馏、起始位置随机化以及历史记录折扣机制。PRAL在CamRest676、MultiWOZ和PersuasionForGood数据集上实现了最先进性能,且无需使用任何标注数据,显著提升了成功率、流畅性、连贯性与多样性。
The recent success of large pre-trained language models such as BERT and GPT-2 has suggested the effectiveness of incorporating language priors in downstream dialog generation tasks. However, the performance of pre-trained models on the dialog task is not as optimal as expected. In this paper, we propose a Pre-trained Role Alternating Language model (PRAL), designed specifically for task-oriented conversational systems. We adopted (Wu et al., 2019) that models two speakers separately. We also design several techniques, such as start position randomization, knowledge distillation, and history discount to improve pre-training performance. We introduce a task-oriented dialog pretraining dataset by cleaning 13 existing data sets. We test PRAL on three different downstream tasks. The results show that PRAL performs better or on par with state-of-the-art methods.
研究动机与目标
- 为解决现有预训练语言模型在任务导向对话系统中对说话人特异性风格处理不佳及对可变长度对话适应性差的问题。
- 通过设计针对对话结构与上下文特性的专用技术,提升对话生成的预训练效果。
- 从13个现有数据集构建一个高质量、多领域的对话语料库(PretrainDial),以支持大规模预训练。
- 在不依赖任务特定标注的情况下,实现在下游任务导向对话任务上的最先进性能。
提出的方法
- PRAL采用两个独立的GPT-2语言模型——一个用于用户,一个用于系统——以建模不同说话人的风格,灵感源自交替角色对话模型(ARDM)。
- 应用起始位置随机化(SPR),以防止位置嵌入与特定话语内容产生纠缠,从而提升在可变长度对话中的泛化能力。
- 采用知识蒸馏技术,由一个大型预训练GPT-2作为教师模型,将常识知识迁移至学生模型,以提升响应质量。
- 历史记录折扣机制通过重新加权对话中的话语,赋予后续轮次更高权重,以更好地保留上下文信息。
- 模型在PretrainDial上进行预训练,该数据集为从13个不同来源(包括电视剧字幕和任务导向对话)精心筛选的142,298条对话。
- 在三个下游任务导向对话数据集(CamRest676、MultiWOZ和PersuasionForGood)上进行微调,并通过自动评估与人工评估指标进行评测。
实验结果
研究问题
- RQ1是否可设计一种专为对话生成优化的预训练语言模型,在任务导向对话任务上超越通用模型?
- RQ2角色特异性建模与知识蒸馏在提升对话连贯性与事实一致性方面效果如何?
- RQ3起始位置随机化在可变长度对话序列中对泛化能力的提升程度如何?
- RQ4高质量、经筛选的预训练数据是否优于规模更大但噪声更多的数据集?
- RQ5在未使用任务标注的情况下,预训练模型是否可实现在下游对话任务上的最先进性能?
主要发现
- 在CamRest676上,PRAL取得21.6的BLEU-4分数,超越SOTA的ARDM模型,并在不使用任何标注的情况下超过最先进方法Sequicity。
- 在MultiWOZ上,PRAL相比LaRL基线模型在BLEU-4上提升68.8%,并在所有指标上优于HDSA与LaRL,包括0.82的整体得分与0.73的多样性得分。
- 在PersuasionForGood上,PRAL相比ARDM将BLEU-2提升63%,并在流畅性、逻辑性、连贯性与多样性的人工评估中显著更优。
- 人工评估显示,PRAL的平均捐赠评分达到0.99,显著高于ARDM的0.62,表明其具有更强的说服力。
- 消融实验证实,从大型教师GPT进行知识蒸馏是最关键的组件,对性能提升贡献最大。
- 尽管仅使用300MB高质量数据(PretrainDial),PRAL仍优于使用30GBReddit数据的DialoGPT,证明了数据质量优于数据规模。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。