Skip to main content
QUICK REVIEW

[论文解读] Regularizing Dialogue Generation by Imitating Implicit Scenarios

Shaoxiong Feng, Xuancheng Ren|arXiv (Cornell University)|Oct 5, 2020
Topic Modeling参考文献 43被引用 4
一句话总结

本文提出了一种基于场景的对话生成框架,通过利用未来的对话历史来隐式建模潜在的上下文知识,从而提升响应的相关性和多样性。通过模仿学习,将教师模型(可访问未来对话轮次)中的场景知识迁移至学生模型(仅限于对话历史),该方法在推理阶段无需未来上下文即可实现响应生成的正则化,进而在四个基准测试中达到最先进性能。

ABSTRACT

Human dialogues are scenario-based and appropriate responses generally relate to the latent context knowledge entailed by the specific scenario. To enable responses that are more meaningful and context-specific, we propose to improve generative dialogue systems from the scenario perspective, where both dialogue history and future conversation are taken into account to implicitly reconstruct the scenario knowledge. More importantly, the conversation scenarios are further internalized using imitation learning framework, where the conventional dialogue model that has no access to future conversations is effectively regularized by transferring the scenario knowledge contained in hierarchical supervising signals from the scenario-based dialogue model, so that the future conversation is not required in actual inference. Extensive evaluations show that our approach significantly outperforms state-of-the-art baselines on diversity and relevance, and expresses scenario-specific knowledge.

研究动机与目标

  • 为解决神经对话模型中缺乏特定上下文知识的问题,此类模型常生成通用或不相关响应。
  • 利用对话历史和未来轮次共同建模潜在对话场景,以编码现实世界交互的上下文信息。
  • 通过模仿学习将场景知识从训练阶段(可访问未来上下文)迁移至推理阶段(不可访问未来上下文),弥合两者之间的差距。
  • 通过场景感知教师模型提供的分层监督信号,正则化学生模型,从而提升响应的多样性和相关性。
  • 证明隐式场景知识可增强开放域对话生成中的泛化能力与鲁棒性。

提出的方法

  • 基于{对话历史, 未来对话}对进行训练,使基于场景的对话模型生成响应,隐式学习场景感知表征。
  • 采用模仿学习,使常规对话模型(学生)模仿基于场景的模型(教师),并在每一隐藏层施加监督,以改善信号传播。
  • 通过教师模型的中间层和输出层蒸馏,对学生模型进行正则化,降低暴露偏差并平滑训练轨迹。
  • 通过引入多个教师模型(包括预训练语言模型)增强知识迁移,丰富先验知识并提升性能。
  • 该框架通过模仿学习将场景知识内化,实现在推理阶段无需未来对话,从而实现真实场景下的实用部署。
  • 采用分层蒸馏,不仅传递最终输出,还传递中间表征,从而提升泛化能力与收敛速度。

实验结果

研究问题

  • RQ1能否利用未来的对话轮次来隐式建模场景知识,从而提升对话生成的质量?
  • RQ2如何将从未来上下文推导出的场景知识迁移至仅在推理时可见对话历史的模型?
  • RQ3采用多层监督的模仿学习是否能提升对话生成模型的泛化能力与鲁棒性?
  • RQ4隐式场景与蒸馏的结合是否能相比现有方法带来更好的多样性与相关性?
  • RQ5使用多个教师模型(如预训练语言模型)对框架中的性能与知识迁移有何影响?

主要发现

  • 所提出的RegDG方法在四个对话数据集上均达到最先进性能,在多样性和相关性指标上均优于现有基线模型。
  • 在DailyDialog数据集上,增加预训练语言模型作为额外教师,使Dist-1从1.1提升至1.3,Dist-2从4.4提升至5.0,BLEU从19.1提升至19.4。
  • 多教师模型在所有指标上均表现出一致改进,仅相关性略有下降,归因于语言模型无条件生成的特性。
  • 采用更模块化的硬迁移可加速收敛,验证损失更早达到最低点。
  • 消融实验证实,分层蒸馏(多层模仿)比仅顶层蒸馏更有效,可缓解信号延迟问题。
  • 大量分析表明,模仿隐式场景可对学生模型进行正则化,引导其进入更宽广的局部最小值,从而获得更优的泛化性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。