Skip to main content
QUICK REVIEW

[论文解读] NEXUS Network: Connecting the Preceding and the Following in Dialogue Generation

Hui Su, Xiaoyu Shen|arXiv (Cornell University)|Sep 27, 2018
Topic Modeling被引用 6
一句话总结

该论文提出NEXUS Network,一种对话生成模型,通过最大化话语与前后对话上下文之间的互信息来提升响应的连贯性。通过引入可学习的连续码空间和可微变分推理框架,实现了无需依赖离散标记梯度的端到端训练,在两个基准数据集上生成了更具上下文相关性和互动性的响应。

ABSTRACT

Sequence-to-Sequence (seq2seq) models have become overwhelmingly popular in building end-to-end trainable dialogue systems. Though highly efficient in learning the backbone of human-computer communications, they suffer from the problem of strongly favoring short generic responses. In this paper, we argue that a good response should smoothly connect both the preceding dialogue history and the following conversations. We strengthen this connection through mutual information maximization. To sidestep the non-differentiability of discrete natural language tokens, we introduce an auxiliary continuous code space and map such code space to a learnable prior distribution for generation purpose. Experiments on two dialogue datasets validate the effectiveness of our model, where the generated responses are closely related to the dialogue context and lead to more interactive conversations.

研究动机与目标

  • 解决序列到序列对话模型中存在泛化、偏离主题响应的问题。
  • 通过确保响应与对话历史和未来上下文有意义地衔接,提升对话连贯性。
  • 在离散语言标记不可微的情况下,实现可微训练。
  • 在推理阶段缺乏未来上下文时,通过在连续码空间上学习先验分布来实现有效响应生成。
  • 在不依赖后处理重排序或启发式解码的情况下,实现更好的响应多样性和相关性。

提出的方法

  • 引入一个连续码空间,作为对话历史、当前话语和未来上下文的共享表征。
  • 使用变分推理最大化当前话语与历史和未来上下文之间的互信息,以实现可微训练。
  • 在码空间上学习先验分布,以在推理阶段无需真实未来上下文的情况下实现高效采样。
  • 使用变分后验近似码空间的真实后验分布,通过重参数化实现通过离散标记的反向传播。
  • 采用联合优化目标,通过加权系数平衡与过去和未来上下文的互信息。
  • 使用辅助码空间作为离散输出的可微桥梁,通过最大似然估计实现端到端训练。

实验结果

研究问题

  • RQ1通过最大化响应与前后对话上下文之间的互信息,能否提升响应质量?
  • RQ2在处理离散自然语言标记时,如何以可微方式优化互信息?
  • RQ3在推理阶段无法访问未来上下文时,对连续码空间学习可学习先验是否能实现有效的响应生成?
  • RQ4建模过去和未来上下文是否相比自回归基线模型能生成更连贯且更多样化的响应?
  • RQ5所提方法能否降低生成泛化响应(如“我不知道”或“我不确定”)的倾向?

主要发现

  • NEXUS Network通过强制响应与对话历史和未来上下文更强的对齐,显著降低了“我不知道”和“我不确定”等泛化响应的频率。
  • 在Ubuntu和DailyDialog数据集上,该模型在BLEU、BLEU-4和distinct-4指标上均表现更优,表明生成响应的流畅性和多样性得到提升。
  • 人工评估显示,NEXUS生成的响应更具连贯性和互动性,与对话上下文的相关性更高。
  • 在自动评估和人工评估中,该模型均优于强大的基线模型,如seq2seq、基于VAE的模型以及重排序方法。
  • 消融实验证实,联合建模过去和未来上下文相比仅建模单一方向能获得更优性能。
  • 在码空间上使用可学习先验,即使在无法访问真实未来话语的情况下,也能实现有效的推理采样。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。