Skip to main content
QUICK REVIEW

[論文レビュー] Improved Beam Search for Hallucination Mitigation in Abstractive Summarization

Arvind Krishna Sridhar, Erik Visser|arXiv (Cornell University)|Dec 6, 2022
Topic Modeling被引用数 7
ひとこと要約

この論文は、要約の要因としての幻覚を軽減するため、Salience-enhanced greedy decoding中に入力文脈と中間のビーム仮説の間で entailment スコアを計算することで、NLIを支援するビーム再順序付けメカニズムを提案している。この手法は、XSum および CNN/DM データセットにおける人間評価でベースラインを上回り、モデルの微調整や複雑な後処理を必要とせずに事実的一致性を向上させることを示している。

ABSTRACT

Advancement in large pretrained language models has significantly improved their performance for conditional language generation tasks including summarization albeit with hallucinations. To reduce hallucinations, conventional methods proposed improving beam search or using a fact checker as a postprocessing step. In this paper, we investigate the use of the Natural Language Inference (NLI) entailment metric to detect and prevent hallucinations in summary generation. We propose an NLI-assisted beam re-ranking mechanism by computing entailment probability scores between the input context and summarization model-generated beams during saliency-enhanced greedy decoding. Moreover, a diversity metric is introduced to compare its effectiveness against vanilla beam search. Our proposed algorithm significantly outperforms vanilla beam decoding on XSum and CNN/DM datasets.

研究の動機と目的

  • 大規模言語モデルが生成する要約における幻覚という持続的な問題に対処すること。
  • モデルの微調整や外部の事実チェックパイプラインを必要とせず、一般化可能で推論時に行える幻覚軽減手法を開発すること。
  • FactCC や SummaC、QGQA などの既存の事実性ベンチマークの限界を評価し、露呈すること。
  • ビームデコード段階で計算された NLI entailment スコアが、より事実的一致性の高い出力を指向するのに効果的であることを示すこと。
  • 公に利用可能な要約データセットにおける人間評価を通じて、本手法の有効性を検証すること。

提案手法

  • 本手法は、入力文脈の重要な部分に注目するようにするため、salience-enhanced greedy decoding を用いて中間のビーム仮説を生成する。
  • 各デコードステップで、現在の部分要約と入力文脈の間で自然言語推論(NLI)の entailment スコアを計算する。
  • 累積的な NLI entailment 確率に基づいてビームを再順序付けし、入力によってより強く意味的に支持されている仮説を優先する。
  • 本手法は NLI スコアをビームサーチに直接統合しており、モデルパラメータを変更せずにトークンレベルでのビーム確率を修正する。
  • 本手法は、タスク固有の微調整を必要とせず、異なるモデルやデータセットへ容易に一般化可能である。
  • ヒューリスティック制約や事後的な事実チェックに依存するのではなく、デコード中に意味的マッチングを用いることで、事実的生成に向かせる。

実験結果

リサーチクエスチョン

  • RQ1ビームデコード中に計算された NLI entailment スコアは、要約生成における幻覚を効果的に軽減できるか?
  • RQ2提案手法の NLI を支援するビーム再順序付けは、既存の幻覚軽減ベースラインと比較して、事実的一致性においてどのように優れているか?
  • RQ3現在の事実性評価ベンチマーク(FactCC、SummaC、QGQA)は、現実世界の要約出力における幻覚をどの程度検出できないか?
  • RQ4一般向けで推論時に行える手法が、モデルの微調整やアーキテクチャ変更なしに事実的一致性を向上させられるか?
  • RQ5ビームレベルでの NLI 結果の統合は、vanilla ビームサーチや PINOCCHIO と比較して、より一貫性があり事実に整合した要約を生成するか?

主な発見

  • 提案された NLI を支援するビーム再順序付け手法は、XSum および CNN/DM データセットにおける人間評価で、vanilla ビームサーチや PINOCCHIO を顕著に上回った。
  • 人間評価者は、本手法で生成された要約が、ベースライン手法の要約よりも事実的一致性が高く、幻覚が少ないとして評価した。
  • 本手法は、多様な入力タイプや要約長にわたり一貫した改善を示し、強い一般化性を示した。
  • 本研究では、FactCC や SummaC、QGQA といった既存の事実性ベンチマークが、特に要約生成における複雑な幻覚を検出できていないことが判明した。
  • アブレーションスタディの例から、ビームレベルでの NLI スコアが、初期のビームに幻覚を含んでも、モデルを事実的に支持される仮説へと的確に再方向けていることが示された。
  • 本手法は、推論時間の増加や追加のモデルパラメータ、微調整を必要とせず、事実的一致性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。