Skip to main content
QUICK REVIEW

[論文レビュー] Hint-Based Training for Non-Autoregressive Machine Translation

Zhuohan Li, Zi Lin|arXiv (Cornell University)|Sep 15, 2019
Natural Language Processing Techniques参考文献 19被引用数 12
ひとこと要約

本稿では、事前学習済みの自己回帰的教師モデルの隠れ状態の類似性と注意分布を活用することで、翻訳品質を向上させるヒントベースのトレーニング手法を提案する。この手法により、非自己回帰的神経機械翻訳(NART)の性能が著しく向上し、強力なLSTMベースの自己回帰的モデルと同等のBLEUスコアを達成する一方で、自己回帰的ベースライン比で30.2倍の高速化が実現され、計算コストの高いコンponentを追加しない。

ABSTRACT

Due to the unparallelizable nature of the autoregressive factorization, AutoRegressive Translation (ART) models have to generate tokens sequentially during decoding and thus suffer from high inference latency. Non-AutoRegressive Translation (NART) models were proposed to reduce the inference time, but could only achieve inferior translation accuracy. In this paper, we proposed a novel approach to leveraging the hints from hidden states and word alignments to help the training of NART models. The results achieve significant improvement over previous NART models for the WMT14 En-De and De-En datasets and are even comparable to a strong LSTM-based ART baseline but one order of magnitude faster in inference.

研究の動機と目的

  • 非自己回帰的翻訳(NART)モデルの翻訳品質の低さに起因する、自己回帰的依存関係の欠如に起因する一貫性の欠如を是正すること。
  • 複雑なアーキテクチャの変更を避けることで、推論速度を損なわずNARTの性能を向上させること。
  • 自己回帰的モデルの隠れ状態の相関関係と注意分布が、NARTトレーニングの有効な監視信号として機能するかどうかを検証すること。
  • NARTの性能を強力な自己回帰的ベースラインと同等にし、同時に桁違いの高速な推論を維持すること。

提案手法

  • 事前学習済みの自己回帰的モデル(ART)を教師として用い、監視のために隠れ状態表現と注意分布を抽出する。
  • 2種類のヒントを導入する:(1) 冗長的・繰り返しの多い出力を抑えるために、隠れ状態の類似性正則化を導入し、(2) アライメントに基づく注意蒸留により、注意分布の質を向上させる。
  • NARTモデルは、負の対数尤度(NLL)、アライメント損失、隠れ状態類似性損失を組み合わせたマルチタスク損失関数でトレーニングされる。
  • 隠れ状態類似性損失は、異なる位置におけるデコーダー隠れ状態間のコサイン類似度を最小化することで、繰り返し予測を抑制する。
  • アライメント損失は、NARTモデルのエンコーダ-デコーダー注意が、ART教師モデルの注意パターンに一致するように促進する。
  • 本手法は、元の文のコピーを入力とし、自己注意層に自己回帰的マスクを追加しないTransformerベースのNARTモデルに適用される。

実験結果

リサーチクエスチョン

  • RQ1自己回帰的モデルの隠れ状態表現は、非自己回帰的翻訳モデルのトレーニングを向上させることができるか?
  • RQ2自己回帰的モデルからの注意分布の蒸留は、NART出力の曖昧さを低減し、アライメントを改善するか?
  • RQ3ヒントベースのトレーニングにより、計算コストの増加なしにNARTと自己回帰的モデルの性能格差を埋めることができるか?
  • RQ4隠れ状態類似性と注意蒸留は、NARTモデルにおける繰り返しや整合性のないフレーズ生成をどの程度低減するか?

主な発見

  • 提案手法のヒントベースNARTモデルは、WMT14 De-Enで25.55のBLEUスコアを達成し、最良の先行NARTモデル(LT with rescoring)を3.0 BLEUポイント上回った。
  • WMT14 En-Deでは21.11のBLEUスコアを記録し、以前のSOTA NARTモデル(LT with rescoring)を1.9 BLEUポイント上回った。
  • 自己回帰的Transformerベースライン比で30.2倍の推論高速化が達成され、1文あたりのレイテンシはわずか26msであった。
  • IWSLT14 De-Enでは、翻訳における繰り返し語の割合が8.3%から6.5%に低下し、出力の一貫性が向上した。
  • アブレーションスタディの結果、アライメントヒントが全体の性能に1.6 BLEUポイント、隠れ状態ヒントが0.8 BLEUポイント貢献した。
  • 長文(長さ≥40)では、ベースライン比でBLEUスコアが3.15ポイント向上(20.63 vs. 17.48)し、優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。