Skip to main content
QUICK REVIEW

[論文レビュー] Understanding and Detecting Hallucinations in Neural Machine Translation via Model Introspection

Weijia Xu, Sweta Agrawal|arXiv (Cornell University)|Jan 18, 2023
Topic Modeling被引用数 6
ひとこと要約

本稿では、層別尤度プロパゲーション(LRP)を用いて、内部モデルの兆候——特に、集中化され、時間的に変化しないソーストークン寄与——を特定することにより、ニューラル機械翻訳(NMT)におけるガラスボックス型幻覚検出手法を提案する。この手法は、英語・中国語およびドイツ語・英語のテストセットにおける自然な幻覚を検出する際、モデルフリーなベースラインおよび事前学習モデルに基づくブラックボックス検出器を上回る性能を発揮する。

ABSTRACT

Neural sequence generation models are known to "hallucinate", by producing outputs that are unrelated to the source text. These hallucinations are potentially harmful, yet it remains unclear in what conditions they arise and how to mitigate their impact. In this work, we first identify internal model symptoms of hallucinations by analyzing the relative token contributions to the generation in contrastive hallucinated vs. non-hallucinated outputs generated via source perturbations. We then show that these symptoms are reliable indicators of natural hallucinations, by using them to design a lightweight hallucination detector which outperforms both model-free baselines and strong classifiers based on quality estimation or large pre-trained models on manually annotated English-Chinese and German-English translation test beds.

研究の動機と目的

  • ニューラル機械翻訳(NMT)における幻覚の原因に関する体系的な理解の欠如に取り組む。
  • 推論中に幻覚を示す兆候として信頼性の高い内部モデルの兆候を同定する。
  • 自然で摂動の加えられていない入力に一般化可能な軽量で解釈可能な幻覚検出器を開発する。
  • 従来のモデルフリーおよびブラックボックス手法と比較して、検出精度と耐障害性を向上させる。
  • 将来のNMTの信頼性に関する研究を支援するため、人間がアノテートした自然な幻覚を含むテストベッドを公開する。

提案手法

  • 対照的入力摂動を用いて、幻覚的でない翻訳ペアと幻覚的な翻訳ペアを生成する。
  • 層別尤度プロパゲーション(LRP)を適用し、ソースおよびターゲット系列からのトークン寄与度を計算する。
  • 生成ステップにわたるソース寄与度のパターンを分析し、幻覚の一貫した兆候を同定する。
  • 幻覚を検出する2つの主要な兆候に基づく:(1)少数のソーストークンからの集中化された寄与、(2)時間経過に伴う変化のない寄与分布。
  • これらの兆候を特徴量として用い、自然なテストセットにおける幻覚検出用の軽量分類器を学習する。
  • モデルフリーなベースライン、品質推定モデル、および大規模事前学習モデルに基づくブラックボックス分類器と比較して、検出器の性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1NMTにおける幻覚的翻訳に関連して、一貫して観察される内部モデル行動や兆候は何か?
  • RQ2敵対的摂動を用いて同定された兆候は、自然に発生する翻訳における幻覚検出に一般化可能か?
  • RQ3ソース寄与度のパターンは、アテンションや信頼度に基づく特徴と比較して、幻覚検出にどの程度有効か?
  • RQ4これらの兆候に基づく軽量でガラスボックス型の検出器は、モデルフリーおよびブラックボックス検出手法を上回る性能を発揮できるか?
  • RQ5実世界の翻訳シナリオにおけるドメインシフトに対して、提案手法の検出器はどの程度耐障害性を示すか?

主な発見

  • 集中化され、静的(時間的に変化しない)なソーストークン寄与度パターンは、相対的ソース・ターゲット寄与度指標を上回る強力で信頼性の高い幻覚の兆候である。
  • LRPに基づく兆候検出手法は、摂動を加えた入力から自然な幻覚を含む実世界のテストセットへの一般化が効果的に可能である。
  • 提案された軽量検出器は、大規模事前学習モデルに基づくブラックボックス分類器と比較して、より高い精度とドメインシフトに対する耐障害性を示した。
  • 人間がアノテートした英語・中国語およびドイツ語・英語のテストベッドにおいて、モデルフリーなベースラインおよび品質推定に基づく分類器よりも、幻覚検出の性能が優れている。
  • 本研究では、アテンションパターンやモデルの信頼度スコアと比較して、ソース寄与度パターンが幻覚の予測にはるかに優れていることが明らかになった。
  • 著者らは、英語・中国語およびドイツ語・英語翻訳における自然な幻覚を含む人間がアノテートしたテストセットを公開し、将来的なベンチマークの実施を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。