Skip to main content
QUICK REVIEW

[論文レビュー] Fast Interleaved Bidirectional Sequence Generation

Biao Zhang, Ivan Titov|arXiv (Cornell University)|Oct 27, 2020
Natural Language Processing Techniques参考文献 55被引用数 4
ひとこと要約

この論文では、インタリーブド・バイディレクショナル・デコーダー(IBDecoder)を提案する。IBDecoderは、順方向と逆方向の両方の生成方向から同時にトークンを生成するために、インタリーブド・シーケンス・リオーダーと修正された自己注意マスクを用いる。これにより、自己回帰的デコーディングに比べて最大11倍の高速化を達成し、翻訳や要約の品質は同等またはそれ以上である。これは、非隣接な遠く離れたトークン間の独立性仮定がより望ましいため、左から右への半自己回帰的デコーディングを上回る性能を発揮する。

ABSTRACT

Independence assumptions during sequence generation can speed up inference, but parallel generation of highly inter-dependent tokens comes at a cost in quality. Instead of assuming independence between neighbouring tokens (semi-autoregressive decoding, SA), we take inspiration from bidirectional sequence generation and introduce a decoder that generates target words from the left-to-right and right-to-left directions simultaneously. We show that we can easily convert a standard architecture for unidirectional decoding into a bidirectional decoder by simply interleaving the two directions and adapting the word positions and self-attention masks. Our interleaved bidirectional decoder (IBDecoder) retains the model simplicity and training efficiency of the standard Transformer, and on five machine translation tasks and two document summarization tasks, achieves a decoding speedup of ~2X compared to autoregressive decoding with comparable quality. Notably, it outperforms left-to-right SA because the independence assumptions in IBDecoder are more felicitous. To achieve even higher speedups, we explore hybrid models where we either simultaneously predict multiple neighbouring tokens per direction, or perform multi-directional decoding by partitioning the target sequence. These methods achieve speedups to 4X-11X across different tasks at the cost of <1 BLEU or <0.5 ROUGE (on average). Source code is released at https://github.com/bzhangGo/zero.

研究の動機と目的

  • 神経モデルにおける自己回帰的シーケンス生成の遅い推論速度を解消すること。
  • 半自己回帰的デコーディングにおける独立性仮定が引き起こす品質低下を軽減すること。
  • 一方向または半自己回帰的アプローチと比較して、双方向生成がより効果的であるかを検討すること。
  • モデルパラメータの追加や顕著な訓練オーバーヘッドなしに、効率的かつ高速なデコーディングを可能にすること。
  • 先行手法よりも高い高速化を達成しながら、競争力のある生成品質を維持すること。

提案手法

  • IBDecoderは、左から右および右から左の生成方向からのトークンを1つのシーケンスにインタリーブすることで、ターゲットシーケンスを再編成する。
  • 標準のトランスフォーマー・デコーダーとの互換性を保ちつつ、語彙の位置と自己注意マスクを修正し、内部および両方向間の注意を可能にする。
  • 両方向の対応する位置(例:y₁ と yₙ)間で独立性を仮定することで、並列生成を可能にする。
  • 標準の単方向デコーダー(例:トランスフォーマー)と互換性があり、シーケンス再編成とマスク調整のみを必要とする。
  • ハイブリッドバージョンは、複数語予測(SA)や複数方向分割(IMDecoder)を組み合わせることで、さらなる高速化を実現する。
  • このアプローチは、追加のパラメータや複雑なデータ構築を必要とせず、エンドツーエンドで訓練される。

実験結果

リサーチクエスチョン

  • RQ1標準のトランスフォーマー・デコーダーに構造的変更を加えずに、双方向シーケンス生成を効率的に統合できるか?
  • RQ2左から右への半自己回帰的デコーディングと比較して、左から右および右から左の生成をインタリーブすることで、品質の低下が軽減されるか?
  • RQ3双方向生成における独立性仮定は、一方向の半自己回帰的デコーディングにおけるそれよりも害が少ないか?
  • RQ4このアプローチを用いることで、多様なシーケンス生成タスクにおいて最小限の品質低下でどの程度の高速化が達成できるか?
  • RQ5複数語予測や複数方向分割戦略を用いることで、この手法はどの程度スケーリング可能か?

主な発見

  • IBDecoderは、5つの機械翻訳および2つの要約タスクにおいて、自己回帰的デコーディングに比べ2倍の高速化を達成し、BLEUおよびROUGEスコアは同等である。
  • 平均して、半自己回帰的拡張(IBDecoder+SA)を用いたIBDecoderは、タスク全体で4.2倍から11.15倍の高速化を達成し、BLEUスコアが1未満、ROUGEスコアが0.5未満の低下に抑えられた。
  • モデルは左から右への半自己回帰的デコーディングを上回る品質を示しており、双方向の独立性仮定が一方向のそれよりも害が少ないことを示している。
  • 知識蒸留を用いることで、IBDecoderは6つのタスクのうち5つで標準のトランスフォーマー基準よりもBLEUおよびROUGEスコアで優れている。
  • CDMail要約タスク(長文シーケンスのベンチマーク)では、3.02倍の高速化を達成した。ここでは、非自己回帰的モデルが通常は性能を発揮しない。
  • このアプローチは、モデル圧縮などの他の高速化技術と直交しており、それらと組み合わせることでさらなる向上が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。