Skip to main content
QUICK REVIEW

[論文レビュー] LAVA NAT: A Non-Autoregressive Translation Model with Look-Around Decoding and Vocabulary Attention

Xiaoya Li, Yuxian Meng|arXiv (Cornell University)|Feb 8, 2020
Topic Modeling参考文献 29被引用数 11
ひとこと要約

本稿では、Look-Aroundデコードとボキャブラリー注意力を用いてNATモデルにおけるマルチモダリティ問題に対処する非自己回帰的翻訳モデルLAVA NATを提案する。隣接トークンの予測と全ボキャブラリーへの注目を組み合わせることで、自己回帰モデル比最大20.18倍の高速な推論を達成し、BLEUスコアも競争力のある水準を維持しながら、遅延を顕著に低減した。

ABSTRACT

Non-autoregressive translation (NAT) models generate multiple tokens in one forward pass and is highly efficient at inference stage compared with autoregressive translation (AT) methods. However, NAT models often suffer from the multimodality problem, i.e., generating duplicated tokens or missing tokens. In this paper, we propose two novel methods to address this issue, the Look-Around (LA) strategy and the Vocabulary Attention (VA) mechanism. The Look-Around strategy predicts the neighbor tokens in order to predict the current token, and the Vocabulary Attention models long-term token dependencies inside the decoder by attending the whole vocabulary for each position to acquire knowledge of which token is about to generate. %We also propose a dynamic bidirectional decoding approach to accelerate the inference process of the LAVA model while preserving the high-quality of the generated output. Our proposed model uses significantly less time during inference compared with autoregressive models and most other NAT models. Our experiments on four benchmarks (WMT14 En$ ightarrow$De, WMT14 De$ ightarrow$En, WMT16 Ro$ ightarrow$En and IWSLT14 De$ ightarrow$En) show that the proposed model achieves competitive performance compared with the state-of-the-art non-autoregressive and autoregressive models while significantly reducing the time cost in inference phase.

研究の動機と目的

  • 自己回帰的でないトークン独立性と位置モデリングの不足により、繰り返しや欠落のあるトークンが生成される非自己回帰的翻訳(NAT)におけるマルチモダリティ問題に対処すること。
  • 隣接トークンを活用する新しいLook-Aroundデコード戦略を導入することで、NATにおけるトークンレベルおよび位置レベルの依存関係を向上させること。
  • 文脈的キューを基に全ボキャブラリーに注目できるようにすることで、各デコーダー位置が全語彙を参照できるボキャブラリー注意力(VA)を導入し、長距離のトークン依存関係を強化すること。
  • 他のNATモデルと同等の高速推論を維持しながら、最先端の自己回帰的および非自己回帰的モデルと同等またはそれ以上の性能を達成すること。

提案手法

  • Look-Around(LA)デコードは、現在のトークン予測を支援するために左および右の隣接トークンを同時に予測する。これにより、位置-トークンの不一致が軽減され、局所的な語順モデリングが向上する。
  • ボキャブラリー注意力(VA)は、各デコーダー層が各位置に対して全語彙項目に注目できるようにし、長期的な依存関係を捉え、トークン選択の正確性を向上させる。
  • 動的双方向デコード戦略を導入し、左から右および右から左の両方向からのデコードを繰り返し行うことで、予測を段階的に改善する。
  • 訓練段階で露出バイアスを軽減し一般化性能を向上させるために、微分可能なスケジュールサンプリング(DSS)を採用する。
  • クロスエントロピー損失を用いてエンドツーエンドで訓練し、生成品質を向上させるために動的デコードスケジュールを用いてファインチューニングする。
  • LAおよびVAを標準的なTransformerベースのデコーダーに統合することで、1回のパス推論効率を維持する。

実験結果

リサーチクエスチョン

  • RQ1デコード段階で隣接トークンをモデル化することで、非自己回帰的翻訳の正確性と流暢さが向上するか?
  • RQ2各デコーダー位置で全ボキャブラリーに注目することで、モデルの多様で正確なターゲットトークン生成能力にどのような影響を与えるか?
  • RQ3双方向の文脈とボキャブラリー注意力を組み合わせることで、単方向または独立したトークン生成に比べて性能が向上するか?
  • RQ4非自己回帰的モデルが自己回帰的モデルと同等の性能を達成しつつ、高い推論速度を維持できるか、その程度はどの程度か?
  • RQ5動的双方向デコード戦略は、グリーディおよびビームサーチと比較して、BLEUスコアおよび推論速度の面で優れているか?

主な発見

  • WMT14 En→Deで、左および右のLook-Aroundを併用した場合、標準NATモデル比+9 BLEUポイントの向上を達成し、ベースラインNATを大きく上回った。
  • IWSLT14 De→Enでは、自己回帰的Transformer比20.18倍の高速化を達成し、BLEUスコア33.59を記録した。これは、高い効率性と正確性を示している。
  • Look-Around機構は、複数のNATモデルで性能向上をもたらし、IWSLT14 De→Enで+0.55〜+1.16 BLEUポイントの向上を示した。
  • 微分可能なスケジュールサンプリング(DSS)は、教師強制法および標準的なスケジュールサンプリングと比較して、最も優れた性能を示した。
  • 標準NATモデルとは異なり、LAVA NATは文長が異なる場合でも安定した性能を維持しており、長文では性能が著しく低下しない。
  • 定性的な例では、繰り返しトークンが存在せず、参照訳と高い一貫性を保った翻訳を生成していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。