Skip to main content
QUICK REVIEW

[论文解读] Consistency of a Recurrent Language Model With Respect to Incomplete Decoding

Sean Welleck, Ilia Kulikov|arXiv (Cornell University)|Feb 6, 2020
Topic Modeling参考文献 26被引用 7
一句话总结

本文识别并解决了在不完整解码过程中循环语言模型的不一致性问题,其中诸如束搜索或核采样等解码算法可能生成在模型下概率为零的无限长度序列。作者提出了具有一致性的采样变体以及一种自终止模型架构,可保证输出为有限长度,并通过实证结果表明在 GPT-2 上显著减少了非终止现象,同时保持了强大的语言建模质量。

ABSTRACT

Despite strong performance on a variety of tasks, neural sequence models trained with maximum likelihood have been shown to exhibit issues such as length bias and degenerate repetition. We study the related issue of receiving infinite-length sequences from a recurrent language model when using common decoding algorithms. To analyze this issue, we first define inconsistency of a decoding algorithm, meaning that the algorithm can yield an infinite-length sequence that has zero probability under the model. We prove that commonly used incomplete decoding algorithms - greedy search, beam search, top-k sampling, and nucleus sampling - are inconsistent, despite the fact that recurrent language models are trained to produce sequences of finite length. Based on these insights, we propose two remedies which address inconsistency: consistent variants of top-k and nucleus sampling, and a self-terminating recurrent language model. Empirical results show that inconsistency occurs in practice, and that the proposed methods prevent inconsistency.

研究动机与目标

  • 形式化循环语言模型的概率分布与不完整解码算法所诱导的分布之间的不一致性。
  • 识别为何常用解码方法——贪婪搜索、束搜索、top-k 采样和核采样——即使在模型本身训练为生成有限序列的情况下,仍可能产生在模型下概率为零的无限长度序列。
  • 设计实用的解决方案,确保解码仅生成有限且有效的序列。
  • 通过实证验证,不一致性在实际中确实存在,例如在标准模型如 GPT-2 上。
  • 探索在训练阶段通过序列级学习是否可缓解不一致性问题。

提出的方法

  • 将循环语言模型定义为一个自回归神经网络,其在有限词汇表上计算条件概率,包括一个用于序列终止的特殊 <eos> 标记。
  • 将解码算法形式化为基于模型和上下文诱导序列分布的函数,并将“不一致性”定义为生成在模型下概率为零的无限长度序列。
  • 证明:不完整解码算法——即在每一步排除某些标记的算法——即使在模型本身一致的情况下,也会诱导出不一致的分布。
  • 通过确保在解码过程中 <eos> 标记从不被排除在候选集合之外,提出 top-k 和核采样的一致性变体。
  • 提出一种自终止的循环语言模型架构,通过重新参数化输出层,使 <eos> 标记始终具有较高排名,从而在任何不完整解码策略下保证终止。
  • 在 Wikitext-103 数据集上使用贪婪解码评估方法,通过非终止率和困惑度来评估一致性和生成质量。

实验结果

研究问题

  • RQ1束搜索或核采样等解码算法是否可能生成在循环语言模型下概率为零的无限长度序列?
  • RQ2为何常用解码方法即使在模型训练为生成有限序列的情况下,仍会导致不一致性?
  • RQ3能否设计出一致性的采样变体,以确保 <eos> 标记在解码过程中从不被排除?
  • RQ4能否构建一种自终止模型架构,以确保在任何不完整解码算法下均能产生有限输出?
  • RQ5不一致性是否在实际中真实存在,例如在微调后的 GPT-2 等真实世界模型中?

主要发现

  • 在 Wikitext-103 数据集上,标准 GPT-2-117M 在贪婪解码(500 个标记限制)下的非终止率为 37.91%,表明实际中存在显著的不一致性。
  • 自终止的 GPT-2 变体实现了 0.00% 的非终止率,完全消除了无限生成,同时保持了合理的生成质量。
  • 自终止模型的困惑度从 20.92 上升至 27.25,表明在语言建模质量上存在轻微的权衡,但一致性显著提升。
  • 一致性的采样变体通过确保 <eos> 标记始终包含在候选集合中,防止了无限序列的生成。
  • 自终止模型的后续序列长度分布向更短、更符合实际的序列长度偏移,与真实数据分布更加一致。
  • 实证结果证实,不一致性并非仅理论问题,而是实际部署解码流水线中真实存在的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。