Skip to main content
QUICK REVIEW

[論文レビュー] Blockwise Parallel Decoding for Deep Autoregressive Models

Mitchell Stern, Noam Shazeer|arXiv (Cornell University)|Nov 7, 2018
Image Processing Techniques and Applications被引用数 7
ひとこと要約

本稿では、スコアリングモデルを用いて最長有効プレフィックスを検証することで、複数トークンを並列に予測するブロック単位の並列デコードという手法を提案する。変換器モデルに適用したところ、グリーディデコードと比較して最大3.3倍のリアルタイム速度向上を達成し、品質損失は最小限に抑えられ、性能劣化なしでデコード反復回数を最大2倍まで削減でき、わずかな劣化を許容すれば最大7倍まで向上した。

ABSTRACT

Deep autoregressive sequence-to-sequence models have demonstrated impressive performance across a wide variety of tasks in recent years. While common architecture classes such as recurrent, convolutional, and self-attention networks make different trade-offs between the amount of computation needed per layer and the length of the critical path at training time, generation still remains an inherently sequential process. To overcome this limitation, we propose a novel blockwise parallel decoding scheme in which we make predictions for multiple time steps in parallel then back off to the longest prefix validated by a scoring model. This allows for substantial theoretical improvements in generation speed when applied to architectures that can process output sequences in parallel. We verify our approach empirically through a series of experiments using state-of-the-art self-attention models for machine translation and image super-resolution, achieving iteration reductions of up to 2x over a baseline greedy decoder with no loss in quality, or up to 7x in exchange for a slight decrease in performance. In terms of wall-clock time, our fastest models exhibit real-time speedups of up to 4x over standard greedy decoding.

研究の動機と目的

  • 並列処理が可能であるにもかかわらず、推論速度が制限される自己回帰的シーケンス生成における固有の逐次的ボトルネックを解消すること。
  • 生成品質を損なわず、深層自己回帰モデルにおける高速デコードを実現すること。
  • 最小限のアーキテクチャ変更で、既存モデルと互換性を持つ手法を開発すること。
  • 多様なシーケンス・ツー・シーケンスタスクにおいて、デコード速度と性能のトレードオフを評価すること。

提案手法

  • 本手法は、標準的なグリーディデコードが次トークンを予測するのとは異なり、複数の将来トークンを並列に予測する補助モデルを学習する。
  • 推論時、これらの補助モデルを用いて、k個の将来位置における候補シーケンスを並列に生成する。
  • ベースモデルが同時にすべての予測位置をスコアリングし、グリーディデコードで生成されるはずの最長プレフィックスを検証する。
  • 検証されたプレフィックス長が1より大きい場合、アルゴリズムは複数のデコードステップをスキップし、反復回数を最大k倍まで削減する。
  • 変換器ベースのモデルに、機械翻訳および画像スーパーレゾリューションのタスクに適用し、モデルの変更を最小限に抑えた。
  • 知識蒸留および近似デコードと併用可能であり、品質へのわずかなコストでさらなる高速化が可能である。

実験結果

リサーチクエスチョン

  • RQ1自己回帰的モデルにおいて複数トークンの並列予測が、出力品質を損なわずデコード反復回数を顕著に削減できるか?
  • RQ2既存の高速化技術と比較して、ブロック単位の並列デコードは、速度と性能のトレードオフにおいてどのように評価されるか?
  • RQ3この手法が、最小限のアーキテクチャ変更で既存モデルに適用可能である範囲はどの程度か?
  • RQ4ブロックサイズkを増加させることによる、シーケンス・ツー・シーケンスタスクにおけるスループット向上と生成品質への影響は?
  • RQ5知識蒸留および近似デコードと効果的に組み合わせることで、さらなる高速化が達成できるか?

主な発見

  • 英語=ドイツ語翻訳タスクにおいて、ブロック単位の並列デコードは、標準的なグリーディデコードと比較して最大3.31倍のリアルタイム速度向上を達成し、ベースラインから0.29 BLEUポイントの劣化にとどまった。
  • k=2の場合、品質に損失なしにデコード反復回数を2倍削減し、BLEUスコアは28.95(ベースライン29.11)を維持した。
  • k=8の場合、3.31倍のウォールクロック速度向上を達成し、BLEUスコアは27.88を維持した。これは強力なスケーラビリティを示している。
  • 画像スーパーレゾリューションにおいては、デコード反復回数を最大7倍まで削減でき、わずかな性能低下を伴い、4倍のウォールクロック速度向上を達成した。
  • 人間による評価では、ブロック単位でデコードされた出力が、標準的なグリーディデコード出力と品質的にほとんど同等であることが確認された。特にブロックサイズが小さい場合に顕著であった。
  • 本手法は、機械翻訳や画像生成を含む多様なタスクで有効であり、蒸留および近似デコードと組み合わせることでさらなる向上が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。