Skip to main content
QUICK REVIEW

[論文レビュー] Wat zei je? Detecting Out-of-Distribution Translations with Variational Transformers

Tim Z. Xiao, Aidan N. Gomez|arXiv (Cornell University)|Jun 8, 2020
Natural Language Processing Techniques参考文献 35被引用数 19
ひとこと要約

この論文は、変分推論とドロップアウトを用いたTransformerモデルにおいて、分布外(OOD)入力を検出できる、ニューラル機械翻訳(NMT)のための新しい不確実性測度であるBLEUVarを提案する。予測分散を複数回のスチルティックなフォワードパスを通じて推定することで、エピステミック不確実性を推定し、ドイツ語に似た語彙を用いたオランダ語の文をOOD入力として効果的に特定する。WMT13およびEuroparlデータセットにおいて高い検出性能を達成している。

ABSTRACT

We detect out-of-training-distribution sentences in Neural Machine Translation using the Bayesian Deep Learning equivalent of Transformer models. For this we develop a new measure of uncertainty designed specifically for long sequences of discrete random variables -- i.e. words in the output sentence. Our new measure of uncertainty solves a major intractability in the naive application of existing approaches on long sentences. We use our new measure on a Transformer model trained with dropout approximate inference. On the task of German-English translation using WMT13 and Europarl, we show that with dropout uncertainty our measure is able to identify when Dutch source sentences, sentences which use the same word types as German, are given to the model instead of German.

研究の動機と目的

  • 最先端のNMTモデルにおける不確実性推定の欠如、特に分布外(OOD)入力の検出を目的とする。
  • 翻訳文などの離散的出力の長文シーケンスに特化したスケーラブルな不確実性測度を開発することを目的とする。
  • 翻訳の信頼性が低い、誤りの可能性がある翻訳を人間のレビュー用に特定することで、NMTにおける選択的分類を可能にすることを目的とする。
  • モデルの不確実性が翻訳品質およびOOD検出性能と相関するかどうかを評価することを目的とする。
  • コンピュータビジョン分野におけるベイジアンディープラーニングのツールを、自然言語処理、特に翻訳におけるシーケンスモデリングに拡張することを目的とする。

提案手法

  • 推論中に複数回の確率的フォワードパスを実行して得られるBLEUスコアの分散に基づく、新しい不確実性測度であるBLEUVarを提案する。
  • 同じ入力に対して多様で不確実な予測を生成するために、Transformerモデルにドロップアウトを適用した近似推論を適用する。
  • 推論中にモデル重みのマルコフチェインモンテカルロサンプリングを用いて、出力シーケンス全体の予測不確実性を推定する。
  • 真の重みの事後分布を近似するための変分推論を用い、完全なベイジアン学習を必要とせずに不確実性の定量化を可能にする。
  • 予測サンプリングとBLEUスコアの集約を組み合わせることで、微分可能でシーケンスレベルの不確実性プロキシを構築する。
  • ドロップアウトを含む標準的なTransformerを学習し、得られた予測分散をエピステミック不確実性のプロキシとして用いる。

実験結果

リサーチクエスチョン

  • RQ1ベイジアンディープラーニングのアプローチは、シーケンス・ツー・シーケンスのNMTモデルにおけるエピステミック不確実性を効果的に推定できるか?
  • RQ2提案された不確実性測度BLEUVarは、現実の翻訳シナリオにおいて誤訳やOOD入力と相関するか?
  • RQ3ドイツ語-英語NMTモデルに与えられた、ドイツ語に似た語彙を用いたオランダ語の文を、OODとして検出する際の不確実性推定はどの程度有効か?
  • RQ4不確実性推定は、選択的分類や人間による翻訳の介入を可能にすることで、モデルの信頼性を向上させられるか?
  • RQ5不確実性推定は、さまざまな文の長さや文法的構造においてどのように振る舞うか?

主な発見

  • BLEUVarは、ドイツ語-英語NMTモデルに与えられた、ドイツ語に似た語彙を用いたオランダ語の文を、分布外(OOD)入力として効果的に検出できる。
  • BLEUVarで測定されたモデルの不確実性は翻訳品質と強く相関しており、高い不確実性は誤訳の可能性を示している。
  • WMT13およびEuroparlデータセットにおいて、BLEUVarは、文法的に妥当ではあるがドメイン的に外れの入力文に対しても、高い信頼性でOOD入力を特定できる。
  • 特にOOD入力に対して、決定論的TransformerよりもBLEUVarが不確実または誤った翻訳を特定する能力に優れている。
  • 不確実性推定は文の長さに関わらず安定しているが、長文ではやや不確実性スコアの分散が増加する傾向がある。
  • BLEUVarはバイアス検出の可能性を示しており、バイアスのある学習データはOOD入力として不確実性測度によって特定される可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。