Skip to main content
QUICK REVIEW

[论文解读] Blockwise Parallel Decoding for Deep Autoregressive Models

Mitchell Stern, Noam Shazeer|arXiv (Cornell University)|Nov 7, 2018
Image Processing Techniques and Applications被引用 7
一句话总结

本文提出了一种分块并行解码方法,通过并行预测多个标记并利用评分模型验证最长有效前缀,从而加速自回归序列生成。该方法应用于Transformer模型后,在仅造成轻微质量损失的情况下,相较于贪婪解码实现了高达3.3倍的实时加速,解码迭代次数最多减少2倍而无性能下降,甚至在轻微下降的情况下实现高达7倍的加速。

ABSTRACT

Deep autoregressive sequence-to-sequence models have demonstrated impressive performance across a wide variety of tasks in recent years. While common architecture classes such as recurrent, convolutional, and self-attention networks make different trade-offs between the amount of computation needed per layer and the length of the critical path at training time, generation still remains an inherently sequential process. To overcome this limitation, we propose a novel blockwise parallel decoding scheme in which we make predictions for multiple time steps in parallel then back off to the longest prefix validated by a scoring model. This allows for substantial theoretical improvements in generation speed when applied to architectures that can process output sequences in parallel. We verify our approach empirically through a series of experiments using state-of-the-art self-attention models for machine translation and image super-resolution, achieving iteration reductions of up to 2x over a baseline greedy decoder with no loss in quality, or up to 7x in exchange for a slight decrease in performance. In terms of wall-clock time, our fastest models exhibit real-time speedups of up to 4x over standard greedy decoding.

研究动机与目标

  • 为解决自回归序列生成中固有的顺序瓶颈问题,尽管架构具备并行性,但推理速度仍受限。
  • 在不损害生成质量的前提下,实现深度自回归模型的更快解码。
  • 开发一种与现有模型兼容、仅需极少架构修改的方法。
  • 评估在多样化序列到序列任务中,解码速度与性能之间的权衡。

提出的方法

  • 该方法训练辅助模型以并行预测多个未来的标记,扩展了标准贪婪解码中仅预测下一个标记的范围。
  • 在推理阶段,模型使用这些辅助模型并行生成k个未来位置的候选序列。
  • 基础模型同时对所有预测位置进行评分,以验证在贪婪解码下本应生成的最长前缀。
  • 若验证的前缀长度超过1,则算法可跳过多个解码步骤,使迭代次数最多减少k倍。
  • 该方法应用于基于Transformer的模型,用于机器翻译与图像超分辨率任务,且仅需极少模型修改。
  • 该方法与知识蒸馏和近似解码兼容,可在质量小幅损失的前提下实现进一步加速。

实验结果

研究问题

  • RQ1在自回归模型中并行预测多个标记,是否能显著减少解码迭代次数而不牺牲输出质量?
  • RQ2在速度与性能的权衡方面,分块并行解码相较于现有加速技术表现如何?
  • RQ3该方法在对现有模型进行极少架构修改的前提下,可扩展到何种程度?
  • RQ4在序列到序列任务中,增加块大小k对加速效果与生成质量的影响如何?
  • RQ5该方法是否能与知识蒸馏和近似解码有效结合,以实现进一步的速度提升?

主要发现

  • 在英德翻译任务中,分块并行解码相较于标准贪婪解码实现了高达3.31倍的实时加速,仅造成0.29 BLEU点的性能下降。
  • 当k=2时,该方法将解码迭代次数减少2倍,且质量无损失,BLEU分数保持在28.95(基线为29.11)。
  • 当k=8时,该方法实现了3.31倍的墙钟时间加速,同时保持BLEU分数为27.88,展现出强大的可扩展性。
  • 在图像超分辨率任务中,该方法将解码迭代次数最多减少7倍,性能略有下降,对应4倍的墙钟时间加速。
  • 人工评估确认,分块解码生成的输出在质量上与标准贪婪解码结果基本相当,尤其在小块尺寸下表现更优。
  • 该方法在多样化任务中表现有效,包括机器翻译与图像生成任务,且可与知识蒸馏和近似解码结合,实现进一步性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。