Skip to main content
QUICK REVIEW

[论文解读] Improving Conditional Sequence Generative Adversarial Networks by Stepwise Evaluation

Yi-Lin Tuan, Hung-yi Lee|arXiv (Cornell University)|Aug 16, 2018
Topic Modeling参考文献 30被引用 7
一句话总结

本文提出StepGAN,一种新颖的条件序列生成对抗网络,通过使用修改后的判别器在每个生成步骤分配逐步奖励,从而提升训练稳定性和效率,消除了对计算成本高昂的蒙特卡洛树搜索(MCTS)的依赖。StepGAN在性能上可与MCTS相媲美,同时显著更快,并在生成更丰富多样、更少通用化的回复方面优于先前的SeqGAN和REGS方法,在合成数据和真实对话任务中均表现出色。

ABSTRACT

Sequence generative adversarial networks (SeqGAN) have been used to improve conditional sequence generation tasks, for example, chit-chat dialogue generation. To stabilize the training of SeqGAN, Monte Carlo tree search (MCTS) or reward at every generation step (REGS) is used to evaluate the goodness of a generated subsequence. MCTS is computationally intensive, but the performance of REGS is worse than MCTS. In this paper, we propose stepwise GAN (StepGAN), in which the discriminator is modified to automatically assign scores quantifying the goodness of each subsequence at every generation step. StepGAN has significantly less computational costs than MCTS. We demonstrate that StepGAN outperforms previous GAN-based methods on both synthetic experiment and chit-chat dialogue generation.

研究动机与目标

  • 为解决基于强化学习的序列生成在生成对抗网络中因稀疏奖励导致的不稳定性和低效性问题。
  • 克服SeqGAN中用于逐步评估的蒙特卡洛树搜索(MCTS)带来的高计算成本。
  • 开发一种比MCTS和REGS更高效且有效的替代方法,同时保持高质量的响应生成能力。
  • 评估通过学习的判别器进行逐步评估是否能更好地利用条件序列生成中的对抗训练。
  • 在合成任务和真实对话生成任务中验证该方法的有效性。

提出的方法

  • StepGAN修改判别器,使其在每个生成步骤输出每个子序列的状态-动作值(即时奖励),从而支持使用策略梯度进行端到端训练。
  • 判别器被训练以在每个步骤区分真实序列与生成序列,从而在整个生成过程中提供密集且富有信息量的奖励。
  • 生成器通过使用来自逐步判别器的奖励进行优化,减少暴露偏差,并支持更好的探索。
  • 该方法通过直接从判别器学习价值函数,避免了树搜索,与MCTS相比显著降低了推理时间。
  • 该方法通过训练生成器以最大化来自逐步判别器的期望奖励,应用于序列生成任务。
  • 该框架通过强化学习进行端到端训练,判别器被持续更新以提供准确的逐步反馈。

实验结果

研究问题

  • RQ1能否在不依赖蒙特卡洛树搜索(MCTS)的情况下,训练判别器以提供准确的逐步奖励?
  • RQ2通过学习的判别器进行逐步评估,在训练效率和响应质量方面与MCTS和REGS相比如何?
  • RQ3StepGAN是否能减少最大似然估计中常见的生成通用化回复的倾向?
  • RQ4与现有基于GAN的方法相比,StepGAN是否能更有效地平衡前向和后向KL散度?
  • RQ5所提出的方法是否可泛化至对话生成之外的其他条件序列生成任务?

主要发现

  • StepGAN在计算效率上优于MCTS,在对话生成任务中最快可快五倍,在合成任务中快两倍。
  • 与MLE、SeqGAN和REGS相比,StepGAN生成的通用化回复更少,匹配训练数据的回复比例最低,表明其更具创造性。
  • 在合成任务中,与其它方法相比,StepGAN在前向和后向KL散度之间实现了更均衡的分布对齐。
  • 在对话生成任务中,StepGAN生成的响应质量更高,具有更好的连贯性和多样性,经人工评估和示例输出验证。
  • StepGAN在性能上可与MCTS相媲美,但计算成本显著降低,适用于大规模训练。
  • 该方法有效减少了暴露偏差,提升了响应质量,尤其在生成非冗余、上下文相关的回复方面表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。