[論文レビュー] Detecting Hallucinated Content in Conditional Neural Sequence Generation
本稿は、ニューラルシーケンス生成における入力に裏付けられていない生成コンテンツを特定する、トークンレベルの幻覚検出タスクを導入する。合成幻覚と微調整された事前学習言語モデルを用いた手法を提案し、機械翻訳および要約生成の両方で優れた性能を達成。幻覚に配慮した損失の切り詰めとノイズデータのフィルタリングにより、低資源MTの性能向上を実証する。
Neural sequence models can generate highly fluent sentences, but recent studies have also shown that they are also prone to hallucinate additional content not supported by the input. These variety of fluent but wrong outputs are particularly problematic, as it will not be possible for users to tell they are being presented incorrect content. To detect these errors, we propose a task to predict whether each token in the output sequence is hallucinated (not contained in the input) and collect new manually annotated evaluation sets for this task. We also introduce a method for learning to detect hallucinations using pretrained language models fine tuned on synthetic data that includes automatically inserted hallucinations Experiments on machine translation (MT) and abstractive summarization demonstrate that our proposed approach consistently outperforms strong baselines on all benchmark datasets. We further demonstrate how to use the token-level hallucination labels to define a fine-grained loss over the target sequence in low-resource MT and achieve significant improvements over strong baseline methods. We also apply our method to word-level quality estimation for MT and show its effectiveness in both supervised and unsupervised settings. Codes and data available at https://github.com/violet-zct/fairseq-detect-hallucination.
研究の動機と目的
- 入力に根拠のない事実的に誤りな出力を生成するニューラルシーケンス生成における幻覚的コンテンツの問題に対処すること。
- 参照出力が不要な、タスクに依存せず実行時に対応可能な幻覚検出手法を開発すること。
- 機械翻訳および要約生成における幻覚検出のための高品質な人間アノテーションデータセットを構築すること。
- 幻覚ラベルを用いて誤ったトークンの損失をフィルタリングまたは切り詰めることで、低資源設定における学習を改善すること。
- 幻覚検出がニューラル機械翻訳における単語レベルの品質推定および自己学習にどのように有効であるかを示すこと。
提案手法
- 生成シーケンスの各トークンが入力に裏付けられていない(幻覚的である)か否かを予測する新しいタスクを提案する。
- バックトランスレーションやその他のデータ拡張技術を用いて、参照出力に非含意的スパンを挿入することで、合成された幻覚データを作成する。
- 合成幻覚データ上で事前学習済み言語モデル(例:BERT)を微調整し、トークンレベルの幻覚検出を学習する。
- 学習済み検出器を推論時に適用し、実行時における忠実度の評価を可能にする。
- トークンレベルの幻覚ラベルを用いて、低資源MTにおける細かく粒度の細かい損失の切り詰めスキームを定義し、幻覚的トークンの勾配を破棄する。
- 監視ありおよび非監視ありの両設定において、単語レベルの品質推定にこの手法を適用し、あらゆる設定で有効性を示す。
実験結果
リサーチクエスチョン
- RQ1参照出力や人間によるアノテーションがなくても、トークンレベルで幻覚的コンテンツを検出できるか?
- RQ2合成幻覚で学習したモデルは、ゼロショットまたはフェイントショット設定において、実際の幻覚を検出するのにどの程度有効か?
- RQ3トークンレベルの幻覚検出は、ノイズの多い訓練データのフィルタリングや自己学習の改善を通じて、低資源ニューラル機械翻訳を向上させられるか?
- RQ4幻覚に配慮した損失の切り詰めは、標準的な学習と比較して幻覚の削減とBLEUスコアの向上の両面で優れているか?
- RQ5幻覚検出モデルは、監視ありおよび非監視ありのMT設定において、単語レベルの品質推定に効果的に応用できるか?
主な発見
- 本手法は、人間によるアノテーションデータを一切使用しないベンチマークデータセットで平均F1スコア約0.6を達成し、この新タスクの強力なベースラインを確立した。
- 低資源MTでは、幻覚に配慮した損失の切り詰め手法が強力なベースラインを上回り、ネパール語-英語および僧伽羅語-英語のWMT2019共有タスクで新たなSOTA結果を達成した。
- Ne-EnおよびSi-Enのテストセットでは、それぞれBLEUスコア7.4および8.11を達成し、WMT19共有タスクの最良の提出物を上回った。
- 1000万件のノイズの多い訓練データに対して、本手法はBLEU 5.18の妥当な性能を維持したのに対し、ベースラインはBLEU 0.14にとどまり、極度のノイズに強く対応できることを示した。
- 監視ありおよび非監視ありの両設定において、単語レベルの品質推定が向上し、MTにとどまらない汎用性を示した。
- 自己学習における幻覚ラベルの使用により、幻覚率が低下し、モデル性能が向上した。これは、教師モデルがノイズを含む出力を生成しても有効であることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。