Skip to main content
QUICK REVIEW

[論文レビュー] Entity-level Factual Consistency of Abstractive Text Summarization

Nan Feng, Ramesh Nallapati|arXiv (Cornell University)|Feb 18, 2021
Topic Modeling参考文献 16被引用数 5
ひとこと要約

本稿では、要約生成における幻覚現象を定量化するためのエンティティレベルの事実的整合性メトリクス——precision-source (prec_s)、precision-target (prec_t)、recall-target (recall_t)——を提案する。訓練データを、語彙外エンティティを含む要約を除外するフィルタリング処理と、エンティティ分類ヘッドを備えたマルチタスク学習を導入することで、要約生成におけるエンティティ幻覚を顕著に低減し、XSUMではprec_sを94%未満から98%以上に向上させたが、ROUGEスコアは維持された。

ABSTRACT

A key challenge for abstractive summarization is ensuring factual consistency of the generated summary with respect to the original document. For example, state-of-the-art models trained on existing datasets exhibit entity hallucination, generating names of entities that are not present in the source document. We propose a set of new metrics to quantify the entity-level factual consistency of generated summaries and we show that the entity hallucination problem can be alleviated by simply filtering the training data. In addition, we propose a summary-worthy entity classification task to the training process as well as a joint entity and summary generation approach, which yield further improvements in entity level metrics.

研究の動機と目的

  • 要約生成におけるエンティティ幻覚——出典文書に存在しないエンティティを生成する——という長年の問題に対処すること。
  • ROUGEに依存しない、信頼性の高い自動メトリクスを確立し、エンティティレベルの事実的整合性を定量化すること。
  • データフィルタリング、マルチタスク学習、および一括生成によって、事実的整合性を向上させつつROUGEスコアを損なわないようにすること。
  • 標準的なニュース要約データセット(XSUM、CNN/DailyMail、Newsroom)上で、これらの手法の有効性を評価すること。

提案手法

  • 主なメトリクスとしてprecision-source (prec_s) を提案:prec_s = |summaryに含まれるエンティティ ∩ sourceに含まれるエンティティ| / |summaryに含まれるエンティティ|。幻覚率を測定する。
  • 生成要約とゴール要約とのエンティティレベルでの整合性を評価するため、precision-target (prec_t) と recall-target (recall_t) を導入。
  • エンティティのマッチングに、汎用的なNER(SpaCy)とヒューリスティクスを適用し、n-gram、大文字・小文字を区別しない、ストップワードを除外したマッチングを可能にした。
  • 要約にソース文書に存在しないエンティティを含む訓練例を除外する単純なデータフィルタリング手法を適用。
  • 訓練中に要約に適したエンティティを分類するマルチタスク学習のヘッドを導入し、エンティティ選択を支援。
  • 要約と顕著なエンティティのリストを同時に生成するジョイントシーケンス生成モデルを提案。

実験結果

リサーチクエスチョン

  • RQ1BARTのような最先端の要約生成モデルは、どの程度エンティティレベルの事実的整合性に欠けるか?
  • RQ2prec_s、prec_t、recall_tといった自動メトリクスは、生成要約のエンティティレベルの事実的整合性を信頼性高く定量化できるか?
  • RQ3語彙外エンティティを含む要約を除外する訓練データのフィルタリングは、テスト段階での幻覚を低減するか?
  • RQ4エンティティ分類を伴うマルチタスク学習は、ROUGEスコアを損なわず、エンティティレベルの事実的整合性を向上させられるか?
  • RQ5標準的な自己回帰的デコードとは異なり、エンティティと要約を同時に生成するアプローチは、エンティティレベルのメトリクスをさらに向上させられるか?

主な発見

  • XSUMデータセットの正解要約には、平均してprec_sが94%未満という高いレベルのエンティティ幻覚が見られた。
  • データフィルタリングのみで、XSUMテストセットのprec_sが94%未満から98%以上に向上し、幻覚が顕著に低減した。
  • マルチタスクエンティティ分類ヘッドの追加により、prec_sおよびその他のエンティティレベルメトリクスがさらに向上し、ROUGEスコアは劣化しなかった。
  • ジョイントエンティティおよび要約生成アプローチにより、エンティティレベルのメトリクスに追加の向上が見られたが、ROUGEスコアはわずかに低下した。
  • 10例のXSUMバリデーション例を手動で評価した結果、NERおよびマッチングパイプラインの精度が高く、提案メトリクスの信頼性が裏付けられた。
  • 提案されたメトリクスおよび手法は、XSUM、CNN/DailyMail、Newsroomを含む複数のデータセットで有効であり、事実的整合性の向上が一貫して得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。