Skip to main content
QUICK REVIEW

[論文レビュー] On Exposure Bias, Hallucination and Domain Shift in Neural Machine Translation

Chaojun Wang, Rico Sennrich|Zurich Open Repository and Archive (University of Zurich)|May 7, 2020
Natural Language Processing Techniques参考文献 32被引用数 13
ひとこと要約

この論文は、ニューラル機械翻訳(NMT)における露出バイアスが幻覚およびドメインシフトと関連することを示し、教師強制を回避する最小リスク学習(MRT)がこれらの問題を軽減することを実証している。MRTはドメイン外性能を0.6–1.5 BLEU向上させ、幻覚を相対的に11–21%削減するとともに、大きなビームサイズでもビームサーチの安定性を向上させる。

ABSTRACT

The standard training algorithm in neural machine translation (NMT) suffers from exposure bias, and alternative algorithms have been proposed to mitigate this. However, the practical impact of exposure bias is under debate. In this paper, we link exposure bias to another well-known problem in NMT, namely the tendency to generate hallucinations under domain shift. In experiments on three datasets with multiple test domains, we show that exposure bias is partially to blame for hallucinations, and that training with Minimum Risk Training, which avoids exposure bias, can mitigate this. Our analysis explains why exposure bias is more problematic under domain shift, and also links exposure bias to the beam search problem, i.e. performance deterioration with increasing beam size. Our results provide a new justification for methods that reduce exposure bias: even if they do not increase performance on in-domain test sets, they can increase model robustness to domain shift.

研究の動機と目的

  • 露出バイアスがNMTにおける幻覚およびドメインシフトに与える実用的影響を調査すること。
  • 露出バイアスが、ビームサイズを大きくするにつれて性能が低下するビームサーチの問題を悪化させるかどうかを検討すること。
  • MRTのようなシーケンスレベルの学習目的が、ドメインシフト下でのモデルの頑健性を向上させられるかどうかを評価すること。
  • MLEとMRTが、各時刻における翻訳の不確実性および確率割り当てをどのように異なるかを分析すること。
  • 低リソースまたはドメイン外設定において幻覚が問題となる状況でMRTを用いる根拠を実証的に提示すること。

提案手法

  • 露出バイアスを回避するため、候補翻訳の期待損失を最適化するシーケンスレベルの目的関数として最小リスク学習(MRT)を用いる。
  • 温度パラメータαを用いて、翻訳の事後分布のサンプリングに基づく近似を実施し、鋭さを制御する。
  • IWSLT’14およびOPUSデータセットを用い、医療、IT、法務、コーラン、字幕など複数のドメインと、低リソースのドイツ語–ロマンシュ語設定で、TransformerベースのNMTモデルを学習する。
  • 教師強制を用いた最大尤度推定(MLE)とMRTを、ドメイン内およびドメイン外のテストセットで比較する。
  • BLEUと幻覚率を用いて翻訳品質を評価し、幻覚検出のための手動アノテーションを実施する。
  • 各時刻における正解翻訳と分散(幻覚)翻訳の予測確率を比較することで、モデルの不確実性を分析する。
Figure 1: Per-token probability of out-of-domain reference translations and in-domain distractors (first two graphs share legend). Rightmost plot shows direct comparison for MLE baseline and final MRT model. DE $\to$ EN OPUS .
Figure 1: Per-token probability of out-of-domain reference translations and in-domain distractors (first two graphs share legend). Rightmost plot shows direct comparison for MLE baseline and final MRT model. DE $\to$ EN OPUS .

実験結果

リサーチクエスチョン

  • RQ1露出バイアスはドメインシフト下におけるNMTにおける幻覚に寄与しているか?
  • RQ2露出バイアスは、ビームサイズを大きくするにつれて性能が低下するビームサーチの問題とどのように関連しているか?
  • RQ3露出バイアスを回避するMRTは、幻覚を低減し、ドメインシフトに対する頑健性を向上させられるか?
  • RQ4MLEとMRTは、デコードステップごとに正解翻訳と幻覚翻訳の確率推定をどのように異なるか?
  • RQ5MRTの利点はドメイン内性能に限定されているのか、それともドメイン外または低リソース設定でも測定可能な向上をもたらすのか?

主な発見

  • MRTはビームサイズにかかわらず幻覚を相対的に11–21%削減し、特にビームサイズ50で最大の削減が観察された。
  • ビームサイズ50の条件下で、MRTはMLEよりもドメイン外BLEUを0.6–1.5 BLEU向上させ、ドメインシフトに対する頑健性の強化を示した。
  • MLEは、特にラベルスムージングを適用した場合、後方の時刻において幻覚翻訳の確率を過大評価する傾向がある。
  • MRTは正解翻訳の確率を分散よりもより強く高め、確率の差を狭めることで幻覚リスクを低減する。
  • MRTによりビームサーチの問題が緩和された:MLEと比較して、ビームサイズを大きくしても性能の低下がやや穏やかになった。
  • 手動評価により、MRTは全ビームサイズで幻覚率が一貫して低減され、MLEと比較して相対的に11–21%の削減が確認された。
Figure 2: Per-token probability of out-of-domain reference translations and in-domain distractors for different checkpoints in MRT training, showing a widening gap between references and distractors. DE $\to$ EN OPUS.
Figure 2: Per-token probability of out-of-domain reference translations and in-domain distractors for different checkpoints in MRT training, showing a widening gap between references and distractors. DE $\to$ EN OPUS.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。