Skip to main content
QUICK REVIEW

[論文レビュー] MoFE: Mixture of Factual Experts for Controlling Hallucinations in Abstractive Summarization.

Prafulla Kumar Choubey, Jesse Vig|arXiv (Cornell University)|Oct 14, 2021
Topic Modeling参考文献 36被引用数 5
ひとこと要約

MoFEは、実体の重複度と従属的アーキテクチャの含意度という指標を用いて、事実的一致性を最小化するように強化学習で訓練された専門的エキスパートを用いることで、抽象的要約における幻覚を低減する。XSUMおよびCNN/DMで事実的一致性が向上し、ROUGEスコアに悪影響を与えることなく、質問-回答の事実性やBERTScore精度といった未観測の指標へも一般化する。

ABSTRACT

Neural abstractive summarization models are susceptible to generating factually inconsistent content, a phenomenon known as hallucination. This limits the usability and adoption of these systems in real-world applications. To reduce the presence of hallucination, we propose the Mixture of Factual Experts (MoFE) model, which combines multiple summarization experts that each target a specific type of error. We train our experts using reinforcement learning (RL) to minimize the error defined by two factual consistency metrics: entity overlap and dependency arc entailment. We construct MoFE by combining the experts using two ensembling strategies (weights and logits) and evaluate them on two summarization datasets (XSUM and CNN/DM). Our experiments on BART models show that the MoFE improves performance according to both entity overlap and dependency arc entailment, without a significant performance drop on standard ROUGE metrics. The performance improvement also transfers to unseen factual consistency metrics, such as question answer-based factuality evaluation metric and BERTScore precision with respect to the source document.

研究の動機と目的

  • 神経的抽象的要約モデルにおける事実的一致性の欠如、すなわち幻覚の問題に対処すること。
  • 要約における異なる誤りタイプに焦点を当てた専門的エキスパートを訓練することで幻覚を低減すること。
  • 実体の重複度と従属的アーキテクチャの含意度という2つの事実的一致性指標を用いて強化学習により事実的一致性を向上させること。
  • 事実的一致性の向上が、訓練時に使用した指標とは異なる未観測の評価指標へも一般化するかどうかを評価すること。
  • 要約出力の事実的整合性を向上させつつも、強力なROUGEスコアを維持すること。

提案手法

  • 特定のタイプの事実的誤りに特化した複数の要約専門エキスパートを訓練する。
  • 各エキスパートを、実体の重複度と従属的アーキテクチャの含意度という2つの事実的一致性指標に基づく報酬信号を最小化するように強化学習で最適化する。
  • 重み付け平均化とロジットレベルの統合という2つのアンサンブル戦略を用いてエキスパートを統合する。
  • BARTベースのアーキテクチャを用いて、2つのベンチマークデータセット(XSUMおよびCNN/DM)でMoFEモデルを評価する。
  • 生成品質を評価するためにROUGE指標を用い、標準的な自動評価で性能が低下しないかを確認する。
  • 事実的一致性の向上が、質問-回答の事実性やBERTScore精度といった未観測の指標へどのように一般化されるかをテストする。

実験結果

リサーチクエスチョン

  • RQ1特定の事実的誤りタイプに特化したエキスパートを訓練することで、抽象的要約における幻覚を低減できるか?
  • RQ2重み付けおよびロジットレベルのアンサンブル戦略を用いることで、ROUGEスコアに悪影響を与えることなく事実的一致性が向上するか?
  • RQ3実体の重複度と従属的アーキテクチャの含意度の向上が、他の事実的一致性指標へどの程度一般化されるか?
  • RQ4MoFEフレームワークは、生成品質を強く維持しつつ、幻覚を顕著に低減できるか?
  • RQ5モデルの事実的一致性向上が、BERTScore精度や質問-回答の事実性といった未観測の評価指標へも一般化されるか?

主な発見

  • XSUMおよびCNN/DMにおいて、MoFEは実体の重複度と従属的アーキテクチャの含意度スコアが向上し、事実的一致性が向上した。
  • 標準的なROUGE指標においても高い性能を維持しており、生成品質に悪影響がないことが示された。
  • 事実的一致性の向上は、未観測の指標、特に元文書に対するBERTScore精度と質問-回答の事実性評価へも一般化された。
  • 事実的一致性指標に基づく強化学習の適用により、多様な評価環境において幻覚が効果的に低減された。
  • 重み付けおよびロジットレベルのアンサンブル戦略により、エキスパート出力がうまく統合され、事実的整合性が向上した。
  • 訓練時に使用した指標とは異なる指標へも、事実的一致性の向上が一般化されることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。