[论文解读] TextGAIL: Generative Adversarial Imitation Learning for Text Generation
TextGAIL 提出了一种生成对抗模仿学习框架,利用大规模预训练语言模型(RoBERTa 和 GPT-2)来稳定训练并提高文本生成中的奖励信号可靠性。通过整合对比判别器和近端策略优化(PPO),TextGAIL 在无条件和有条件文本生成任务上均优于 MLE 基线模型,实现了更优的生成质量和多样性,且判别器能够学习到有意义且可迁移的奖励信号。
Generative Adversarial Networks (GANs) for text generation have recently received many criticisms, as they perform worse than their MLE counterparts. We suspect previous text GANs' inferior performance is due to the lack of a reliable guiding signal in their discriminators. To address this problem, we propose a generative adversarial imitation learning framework for text generation that uses large pre-trained language models to provide more reliable reward guidance. Our approach uses contrastive discriminator, and proximal policy optimization (PPO) to stabilize and improve text generation performance. For evaluation, we conduct experiments on a diverse set of unconditional and conditional text generation tasks. Experimental results show that TextGAIL achieves better performance in terms of both quality and diversity than the MLE baseline. We also validate our intuition that TextGAIL's discriminator demonstrates the capability of providing reasonable rewards with an additional task.
研究动机与目标
- 为解决先前文本 GAN 模型性能不佳的问题,其训练不稳定且奖励信号不可靠。
- 通过利用大规模预训练语言模型作为对抗训练中可靠的奖励提供者,提升文本生成的质量与多样性。
- 通过对比判别器和近端策略优化(PPO)稳定文本 GAN 的训练过程。
- 将对抗训练扩展至条件文本生成任务(如 CommonGEN 和 ROCStories),超越以往仅限于无条件生成的研究工作。
- 通过在下游任务(如 Story Cloze Test)上的零样本评估,验证判别器是否学习到有意义且可迁移的奖励信号。
提出的方法
- TextGAIL 采用生成对抗模仿学习(GAIL)训练生成器,利用判别器提供的奖励信号,通过 PPO 训练生成器以降低策略梯度方差。
- 判别器使用 RoBERTa 初始化,并微调以区分真实文本与生成文本,为生成器提供可靠的奖励信号。
- 采用对比判别器架构,通过比较真实序列与生成序列,提升在条件生成任务上的性能。
- 生成器基于 GPT-2 模型,通过 PPO 进行微调,使用判别器提供的奖励信号,替代标准的 MLE 训练方式。
- 框架采用温度超参数扫描评估,公平比较生成质量与多样性的权衡关系,相对于 MLE 基线模型。
- 消融实验验证了预训练、对比判别与 PPO 优化在性能中的贡献。
实验结果
研究问题
- RQ1大规模预训练语言模型能否提升文本 GAN 中奖励信号的可靠性,从而改善生成性能?
- RQ2结合 GAIL、PPO 与对比判别器是否能稳定训练并提升文本生成的质量与多样性?
- RQ3TextGAIL 中的判别器能否学习到可迁移、有意义的奖励信号,并泛化至下游任务(如故事结尾分类)?
- RQ4TextGAIL 在无条件与条件文本生成任务中,是否在质量-多样性权衡上优于基于 MLE 的基线模型?
- RQ5架构选择(如对比学习与预训练)如何影响文本 GAN 的稳定性和性能?
主要发现
- 在无条件生成任务(COCO、EMNLP2017 News)和条件生成任务(CommonGEN、ROCStories)上,TextGAIL 的生成质量与多样性均优于 MLE 微调基线模型。
- TextGAIL 中的判别器在 Story Cloze Test 上达到 79.1% 的准确率,显著优于微调后的 GPT-2 模型(69.6%),并接近有监督的 RoBERTa 模型(92.8%)。
- 若从判别器中移除预训练,其在 Story Cloze Test 上的准确率降至 51.2%,证实预训练对可靠奖励学习至关重要。
- 若将对比判别器替换为标准的单输入 Sigmoid 判别器,BLEU-2 与 Distinct-2 分数显著下降,表明对比学习对条件生成至关重要。
- 消融实验表明,PPO 与人类示范对稳定训练至关重要,直接使用预训练模型进行 GAN 训练无法收敛。
- TextGAIL 证明了预训练模型可有效引导对抗训练,从而生成更优的奖励信号与更高质量的生成结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。