Skip to main content
QUICK REVIEW

[论文解读] End-to-end Adversarial Learning for Generative Conversational Agents

Oswaldo Ludwig|arXiv (Cornell University)|Nov 28, 2017
Topic Modeling参考文献 23被引用 9
一句话总结

该论文提出了一种用于生成式对话智能体(GCA)的端到端对抗训练方法,通过基于标记级别的判别器来区分上下文中的真人生成与机器生成的对话标记。通过使判别器支持反向传播,该方法提升了响应质量和多样性,对抗训练的响应在人类偏好测试中获得70.11%的得分,而教师强制方法仅获得29.88%,且人类与对抗模型的排名间Jaccard相似度达到0.58。

ABSTRACT

This paper presents a new adversarial learning method for generative conversational agents (GCA) besides a new model of GCA. Similar to previous works on adversarial learning for dialogue generation, our method assumes the GCA as a generator that aims at fooling a discriminator that labels dialogues as human-generated or machine-generated; however, in our approach, the discriminator performs token-level classification, i.e. it indicates whether the current token was generated by humans or machines. To do so, the discriminator also receives the context utterances (the dialogue history) and the incomplete answer up to the current token as input. This new approach makes possible the end-to-end training by backpropagation. A self-conversation process enables to produce a set of generated data with more diversity for the adversarial training. This approach improves the performance on questions not related to the training data. Experimental results with human and adversarial evaluations show that the adversarial method yields significant performance gains over the usual teacher forcing training.

研究动机与目标

  • 解决通过教师强制训练的生成式对话智能体存在的通用性差、多样性低的问题。
  • 通过使判别器支持端到端反向传播,分类单个标记为真人或机器生成,从而提升响应质量与多样性。
  • 训练一个判别器,使其能够对多个模型的候选响应进行排序与选择,实现超越单个模型训练的性能提升。
  • 通过动态调整编码中使用的对话历史轮次数量,探索上下文保持与话题转移检测。

提出的方法

  • 模型采用序列到序列架构,编码器将对话历史编码为思想向量,并在每个解码步骤更新以保持上下文。
  • 判别器执行标记级别的分类,基于对话历史和部分响应,判断每个生成标记更可能来自真人还是机器。
  • 判别器通过对抗损失进行训练,支持生成器与判别器的端到端反向传播,使用标准反向传播而非强化学习。
  • 通过自对话过程生成多样化训练数据,以提升模型在分布外问题上的泛化能力。
  • 将判别器在每个标记处的输出作为得分(通过输出的几何平均值计算),用于候选响应的排序,提升选择准确性。
  • 采用混合损失函数,结合标准交叉熵损失与判别器得分的几何平均值,以平衡流畅性与人类相似度。

实验结果

研究问题

  • RQ1基于标记级别的判别器是否能通过反向传播实现生成式对话智能体的端到端对抗训练?
  • RQ2与教师强制方法相比,使用上下文感知判别器的对抗训练是否能提升响应质量与多样性?
  • RQ3训练好的判别器是否能有效对多个模型的响应进行排序与选择?
  • RQ4对话历史轮次数量如何影响模型的上下文保持与话题转移处理能力?

主要发现

  • 对抗训练模型在直接评估中获得70.11%的人类偏好,显著优于仅获得29.88%投票的教师强制方法。
  • 使用判别器几何平均得分(公式10)对响应进行排序,与人类判断的Jaccard指数达到0.58,表明人类偏好与对抗评分高度一致。
  • 对抗模型获得570票(占总票数的69.34%),而教师强制模型仅获得252票(占30.66%),表明其感知质量更优。
  • 通过对抗学习训练的判别器可被复用于从多个模型中选择最佳响应,当用作选择标准时,获得61.96%的投票。
  • 当 $ N_u = 1 $ 时,上下文保持失败;当 $ N_u > 2 $ 时,模型难以实现话题转换,表明需要动态上下文窗口机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。