Skip to main content
QUICK REVIEW

[论文解读] Rethinking Exposure Bias In Language Modeling

Yifan Xu, Kening Zhang|arXiv (Cornell University)|Oct 13, 2019
Topic Modeling参考文献 24被引用 6
一句话总结

本文提出了一种基于句子补全任务的新评估范式,用于衡量语言建模中的暴露偏差,并引入MEMR框架——该框架采用多熵采样与多范围强化机制,以稳定对抗训练。该方法在句子补全质量与语料BLEU得分方面均达到当前最优性能,表明其有效降低了暴露偏差,并提升了对未见前缀的鲁棒性。

ABSTRACT

Exposure bias describes the phenomenon that a language model trained under the teacher forcing schema may perform poorly at the inference stage when its predictions are conditioned on its previous predictions unseen from the training corpus. Recently, several generative adversarial networks (GANs) and reinforcement learning (RL) methods have been introduced to alleviate this problem. Nonetheless, a common issue in RL and GANs training is the sparsity of reward signals. In this paper, we adopt two simple strategies, multi-range reinforcing, and multi-entropy sampling, to amplify and denoise the reward signal. Our model produces an improvement over competing models with regards to BLEU scores and road exam, a new metric we designed to measure the robustness against exposure bias in language models.

研究动机与目标

  • 建立一种实用的、以评估为导向的方法,用于衡量神经语言模型中的暴露偏差。
  • 解决文本生成中对抗训练的不稳定性与收敛性差的问题。
  • 提升模型在基于模型生成前缀而非真实输入进行序列生成时的鲁棒性。
  • 在保证高质量生成的同时,增强模型对推理过程中分布偏移的适应能力。
  • 证明改进的对抗训练可同时提升生成质量与暴露偏差缓解效果。

提出的方法

  • 提出一种使用训练分布中真实前缀的句子补全任务,用于评估暴露偏差,通过测量前缀长度增加时的性能衰减来衡量。
  • 引入多熵采样,通过在多个温度设置(0.5 至 1.5)下采样,以多样化训练序列,提升对抗训练中的探索能力。
  • 采用多范围强化机制,在生成器的多个中间层提供裁判监督,以实现更稳定且信息量更丰富的奖励信号。
  • 使用具有五个目标值 [0, 0.2, 0.4, 0.6, 0.8] 的裁判网络,以引导生成器在多个置信度水平下学习,增强策略更新的稳定性。
  • 结合演员-评论家强化学习与标准LSTM生成器及八层CNN判别器,使用Adam优化器进行训练。
  • 采用三种BLEU变体——前向BLEU(BLEU_F)、后向BLEU(BLEU_B)与调和平均BLEU(BLEU_HA),联合评估生成质量与多样性。

实验结果

研究问题

  • RQ1能否通过使用受控的真实前缀的句子补全任务有效衡量暴露偏差?
  • RQ2在使用模型生成的前缀生成序列时,带有裁判网络的对抗训练在多大程度上提升了模型的鲁棒性?
  • RQ3多熵采样与多范围强化是否能稳定神经语言建模中的对抗训练?
  • RQ4与教师强制法和先前的GAN方法相比,所提出的MEMR方法在长距离未见前缀上的性能退化程度如何降低?
  • RQ5改进的对抗训练是否能带来更好的生成质量与多样性之间的权衡,如语料BLEU与句子补全指标所衡量的那样?

主要发现

  • MEMR模型在测试集上的句子补全BLEU-F4得分为27.9 ± 0.07,显著优于SeqGAN(21.0 ± 0.11)与RankGAN(22.3 ± 0.11),表明其对暴露偏差具有更强的鲁棒性。
  • 在EMNLP2017 WMT新闻数据集上,MEMR的语料BLEU得分为31.6 ± 0.06,超过所有对比模型,包括LeakGAN(31.6 ± 0.04)与RankGAN(30.1 ± 0.06)。
  • MEMR模型在前缀长度增加时,句子补全精确度的性能下降最为平缓,尤其在未见测试数据上,证实了暴露偏差的降低。
  • 采用教师强制(TF)与调度采样(SS)训练的模型在短前缀上表现强劲,但在长距离未见前缀上性能急剧下降,暴露出严重的暴露偏差。
  • 基于GAN的模型如SeqGAN与RankGAN初始精确度较低,但表现出更强的稳定性与更慢的性能衰减,表明裁判监督带来了内在的鲁棒性。
  • MEMR在测试集上的调和平均BLEU(BLEU_HA)为18.4 ± 0.03,表明其在质量与多样性方面均实现了平衡提升,避免了模式崩溃。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。