Skip to main content
QUICK REVIEW

[论文解读] Hybrid Generative-Retrieval Transformers for Dialogue Domain Adaptation

Igor Shalyminov, Alessandro Sordoni|arXiv (Cornell University)|Mar 3, 2020
Topic Modeling参考文献 36被引用 4
一句话总结

该论文提出了一种基于GPT-2微调的混合生成-检索式Transformer模型,用于少样本对话领域适应,结合序列生成与基于检索的响应选择。在人类评估中,该模型在Multi-domain Wizard-of-Oz(MultiWOZ)数据集上取得了最先进性能,胜率较第二名系统高出4%以上。

ABSTRACT

Domain adaptation has recently become a key problem in dialogue systems research. Deep learning, while being the preferred technique for modeling such systems, works best given massive training data. However, in the real-world scenario, such resources aren't available for every new domain, so the ability to train with a few dialogue examples can be considered essential. Pre-training on large data sources and adapting to the target data has become the standard method for few-shot problems within the deep learning framework. In this paper, we present the winning entry at the fast domain adaptation task of DSTC8, a hybrid generative-retrieval model based on GPT-2 fine-tuned to the multi-domain MetaLWOz dataset. Robust and diverse in response generation, our model uses retrieval logic as a fallback, being SoTA on MetaLWOz in human evaluation (>4% improvement over the 2nd place system) and attaining competitive generalization performance in adaptation to the unseen MultiWOZ dataset.

研究动机与目标

  • 解决在有限领域内数据下训练面向目标的对话系统时的数据效率挑战。
  • 克服纯生成式或纯检索式模型在少样本适应场景下的局限性。
  • 开发一种鲁棒且多样化的响应生成系统,使其在未见领域上具有良好泛化能力。
  • 利用大规模预训练语言模型的迁移学习能力,提升低资源领域上的性能。
  • 在少样本领域适应场景中,实现优越的人工评分响应质量与具有竞争力的自动指标得分。

提出的方法

  • 在小规模领域内支持集上微调基于GPT-2的生成模型,用于响应生成。
  • 集成一个检索组件,通过语义编码从支持集中选择与目标对话上下文最相似的样本。
  • 使用相同的Transformer编码器对目标对话上下文和支持集对话进行编码,以计算语义相似度。
  • 采用对比排序机制,在生成候选与检索候选之间选择最佳响应。
  • 通过一个可学习的排序模块,将生成与检索的响应相结合,生成最终输出。
  • 应用来自预训练语言模型的知识迁移,以增强零样本和少样本适应性能。

实验结果

研究问题

  • RQ1在少样本对话领域适应中,混合生成-检索方法是否能优于纯生成式或纯检索式模型?
  • RQ2在小规模领域内支持集上微调像GPT-2这样的大规模预训练语言模型,在响应生成方面效果如何?
  • RQ3在低资源环境下,基于检索的回退机制在多大程度上能提升响应的多样性与一致性?
  • RQ4该混合模型能否在未见的多领域基准(如MultiWOZ)上实现有效泛化?
  • RQ5在少样本适应场景中,该方法相较于现有最先进系统的人工评分性能提升有多大?

主要发现

  • 该模型在人类成对比较中取得了56.85%的胜率,较第二名系统高出4个百分点以上。
  • 在Meta-WOZ数据集的人工评估中,该模型达到了最先进性能,显著优于基线及其他竞争系统。
  • 该模型在未见的MultiWOZ数据集上表现出具有竞争力的泛化性能,表明其具备强大的零样本适应能力。
  • 自动指标(如BLEU、METEOR和ROUGE-L)在生成式与检索式基线模型上均显示出一致改进。
  • 混合架构提升了响应的多样性与一致性,检索机制在低置信度生成场景下作为稳健的回退方案。
  • 通过在小规模领域内支持集上微调,该模型性能显著提升,即使在标注数据有限的情况下也表现出有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。