Skip to main content
QUICK REVIEW

[論文レビュー] Aligned Cross Entropy for Non-Autoregressive Machine Translation

Marjan Ghazvininejad, Vladimir Karpukhin|arXiv (Cornell University)|Apr 3, 2020
Natural Language Processing Techniques参考文献 30被引用数 68
ひとこと要約

AXEは非自動回帰MTの新しい訓練損失で、微分可能な動的計画法を介してターゲットトークンをモデルの予測と一致させ、クロスエントロピー訓練されたCMLMよりBLEUを大幅に改善しつつ、デコードを高速に保つ。

ABSTRACT

Non-autoregressive machine translation models significantly speed up decoding by allowing for parallel prediction of the entire target sequence. However, modeling word order is more challenging due to the lack of autoregressive factors in the model. This difficultly is compounded during training with cross entropy loss, which can highly penalize small shifts in word order. In this paper, we propose aligned cross entropy (AXE) as an alternative loss function for training of non-autoregressive models. AXE uses a differentiable dynamic program to assign loss based on the best possible monotonic alignment between target tokens and model predictions. AXE-based training of conditional masked language models (CMLMs) substantially improves performance on major WMT benchmarks, while setting a new state of the art for non-autoregressive models.

研究の動機と目的

  • 標準のクロスエントロピー損失の下で非自動回帰MTにおける語順モデリングの難しさを動機づけ、対処する。
  • Aligned Cross Entropy (AXE)を微分可能なアラインメントベースの損失として導入する。
  • AXEの有効性を示すために条件付きマスク言語モデル(CMLM)を訓練し、主要ベンチマークで非自動回帰MTの最先端結果を達成する。
  • AXEがモデルの信頼度、多重解、および長いシーケンスの処理にどのように影響するかを分析する。

提案手法

  • AXEを、ターゲットYと予測P間の最良の単調アラインメント上で計算される損失として定義する。
  • 任意のアラインメントに対してAXEを計算するために、Align、Skip Prediction、Skip Target の3演算子ダイナミックプログラミング更新を使用する。
  • すべての単調アラインメントに対してAXEを最小化する;反対対角線并列化によって1シーケンスあたりの計算時間をO(n+m)で効率的に実装する。
  • 空白トークン(epsilon)を許容し、ターゲット長を予測することでCMLMへAXEを適用する。デコード時には長さ膨張をlambdaというハイパーパラメータで行う。
  • 訓練の変種を試す:Unobserved InputとPartially-Observed Input、すべてを予測する vs マスクを予測する、効果的な訓練設定を特定する。

実験結果

リサーチクエスチョン

  • RQ1AXEは標準のクロスエントロピー訓練に内在する語順不一致への厳しいペナルティを緩和できるか?
  • RQ2AXEはCMLMを用いた標準的なWMTベンチマークで翻訳品質(BLEU)を改善するか?
  • RQ3AXE訓練モデルは生データおよび蒸留データ設定の両方で、他の非自己回帰アプローチおよび自己回帰ベースラインと比較してどうか?
  • RQ4どの訓練の選択肢(例:deltaスキップペナルティ、長さ倍率lambda、部分観測入力)がAXEの性能に最も影響するか?

主な発見

  • AXE訓練済みCMLMは、クロスエントロピーCMLMに対してBLEUを大幅に改善する(平均+5.2 BLEU、ベンチマーク全体)。
  • AXE CMLMsはWMTベンチマークでFlowSeqのような最先端非自己回帰モデルを上回り、競合するセミ自己回帰システムと同等以上の成績を示す。
  • AXEはデコード速度を非自己回帰デコードと同じ速さに保ちつつ、訓練時間のオーバーヘッドは控えめ(約1.2x)。
  • AXEは長いシーケンスにおける多モデリティと反復を低減し、特に長いシーケンスで位置ごとの予測の自信度を高める。
  • 実験はAXEが長いシーケンスの処理を改善し、クロスエントロピー訓練と比べ近傍トークン確率への依存を減らすことを示す。
  • アブレーションは、マスクされたトークン上で損失を計算する部分観測入力と、_deltaおよび_lambdaの適切な値が性能を高めることを示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。