Skip to main content
QUICK REVIEW

[论文解读] Contrastive Decoding: Open-ended Text Generation as Optimization

Xiang Lisa Li, Ari Holtzman|arXiv (Cornell University)|Oct 27, 2022
Natural Language Processing Techniques被引用 7
一句话总结

对比解码(CD)通过优化大型‘专家’语言模型与小型‘业余’模型之间对数概率的差异,同时通过专家模型的输出强制保证合理性,从而提升开放式文本生成的质量。该方法在无需额外训练和最小推理开销的前提下,生成的文本在质量、连贯性和词汇多样性方面均优于仅使用专家模型或标准基线方法(如nucleus采样或top-k采样)的结果。

ABSTRACT

Given a language model (LM), maximum probability is a poor decoding objective for open-ended generation, because it produces short and repetitive text. On the other hand, sampling can often produce incoherent text that drifts from the original topics. We propose contrastive decoding (CD), a reliable decoding approach that optimizes a contrastive objective subject to a plausibility constraint. The contrastive objective returns the difference between the likelihood under a large LM (called the expert, e.g. OPT-13B) and a small LM (called the amateur, e.g. OPT-125M), and the constraint ensures that the outputs are plausible. CD is inspired by the fact that the failures of larger LMs (e.g., repetition, incoherence) are even more prevalent in smaller LMs, and that this difference signals which texts should be preferred. CD requires zero additional training, and produces higher quality text than decoding from the larger LM alone. It also works across model scales (OPT-13B and GPT2-1.5B) and significantly outperforms four strong decoding algorithms (e.g., nucleus, top-k) in automatic and human evaluations across wikipedia, news and story domains.

研究动机与目标

  • 为解决最大概率解码导致输出短小、重复的问题,以及采样方法常引发的不连贯或主题漂移问题。
  • 通过利用大型高性能语言模型(专家)与小型低性能模型(业余)之间的对比,提升开放式文本生成的质量。
  • 开发一种解码策略,放大专家模型的优势,同时抑制小型模型常见的失败模式,如重复和不连贯。
  • 在不进行任何微调或额外训练的前提下,实现优于现有解码方法的生成质量。
  • 证明该方法在不同模型规模和领域(包括维基百科、新闻和故事生成)中具有良好的泛化能力。

提出的方法

  • CD将解码过程建模为一个优化问题,旨在最大化专家语言模型与业余语言模型在下一个词符上的对数概率差异。
  • 目标函数定义为:$ \text{CD} = \log p_{\text{exp}}(x_i \mid x_{<i}) - \log p_{\text{ama}}(x_i \mid x_{<i}) $,其中 $ x_i $ 是候选下一个词符。
  • 一个合理性约束限制搜索范围,仅保留专家语言模型中概率足够高的词符,以确保生成的文本保持流畅和连贯。
  • 该方法以自回归方式运行,基于当前上下文,每次选择一个具有最高对比分数的词符。
  • 该方法使用两个预训练且冻结的语言模型:一个大型专家模型(如OPT-13B)和一个小型业余模型(如OPT-125M),两者均未进行微调。
  • 对比目标隐式偏好那些在专家模型中概率高但在业余模型中概率低的序列,从而突出事实准确、多样化且连贯的延续。

实验结果

研究问题

  • RQ1在不增加额外训练的前提下,大型与小型语言模型之间的对比目标能否提升文本生成质量?
  • RQ2专家与业余模型之间的对比是否能有效抑制重复和不连贯等常见失败模式?
  • RQ3在不同领域中,对比解码与nucleus采样、top-k采样和典型解码等成熟解码策略相比表现如何?
  • RQ4对比解码的性能是否依赖于专家模型与业余模型之间的规模差异?
  • RQ5对比解码能否在保持流畅性的同时,显著提升开放式生成的连贯性和词汇多样性?

主要发现

  • 对比解码在维基百科、新闻和故事生成等不同领域中显著提升了生成文本的连贯性,无论在自动评估还是人工评估中,均优于nucleus采样、top-k采样、典型解码和SimCTG方法。
  • 即使未进行任何额外训练,该方法生成的输出质量仍高于仅从专家模型直接解码的结果。
  • 人工评估显示,CD生成的文本更具连贯性和词汇多样性,同时在流畅性方面与基线模型相当或更优。
  • CD的性能随着专家模型与业余模型之间规模差异的增大而提升,表明当业余模型显著较小时,对比信号更强。
  • CD的推理开销极低,因为业余模型体积小、速度快,因此适用于实时应用场景。
  • 在示例生成中,CD正确生成了关于剧集《Exit Through the Kwik-E-Mart》的连贯且事实准确的延续内容,而nucleus采样则产生了不连贯或偏离主题的输出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。