Skip to main content
QUICK REVIEW

[論文レビュー] Factual Error Correction for Abstractive Summarization Models

Meng Cao, Yue Dong|arXiv (Cornell University)|Oct 17, 2020
Topic Modeling参考文献 18被引用数 12
ひとこと要約

この論文は、ヒューリスティックに汚染されたリファレンス要約で事前に訓練されたニューラルモデルを活用して、要約生成出力における事実誤認を特定・是正するポストエディティング補正モジュールを提案する。モデルは、現実世界の不一致のある要約に対して17.74%の是正率を達成し、一貫性のある要約に対しては1.13%の偽陽性率を示し、事実的一致性評価において先行手法を上回った。

ABSTRACT

Neural abstractive summarization systems have achieved promising progress, thanks to the availability of large-scale datasets and models pre-trained with self-supervised methods. However, ensuring the factual consistency of the generated summaries for abstractive summarization systems is a challenge. We propose a post-editing corrector module to address this issue by identifying and correcting factual errors in generated summaries. The neural corrector model is pre-trained on artificial examples that are created by applying a series of heuristic transformations on reference summaries. These transformations are inspired by an error analysis of state-of-the-art summarization model outputs. Experimental results show that our model is able to correct factual errors in summaries generated by other neural summarization models and outperforms previous models on factual consistency evaluation on the CNN/DailyMail dataset. We also find that transferring from artificial error correction to downstream settings is still very challenging.

研究の動機と目的

  • 要約生成モデルがしばしば幻覚的または誤った事実を生成するという、要約生成における事実的一致性の課題に対処すること。
  • 主な要約生成モデルの再訓練なしに、事実的一致性を向上させるポストエディティング補正モジュールを開発すること。
  • リファレンス要約のヒューリスティック変換によって生成された人工的事実誤認を用いて、補正モデルを訓練すること。
  • 補正モデルを、要約出力の補正ツールおよび事実的一致性評価者としての両方の観点から評価すること。
  • 人工的誤り補正と現実世界の要約生成モデルの誤りとの間の一般化ギャップを調査すること。

提案手法

  • 補正モデルは、最先端の要約生成モデルの誤り分析に着想を得たヒューリスティック変換を用いて、リファレンス要約を汚染した合成データ上で訓練されたシーケンス・ツー・シーケンスモデルである。
  • 汚染技術には、エンティティ置換、時間的シフト、事実の削除が含まれ、要約生成出力で一般的に見られる事実誤認を模倣する。
  • モデルは、元のドラフト要約と元のドキュメントを条件として、補正済み要約を生成するためにエンド・ツー・エンドでファインチューニングされる。
  • 補正モデルとしての評価(不一致のある要約を含むテストセットで)と、一貫性評価者としての評価(編集が必要かどうかを検出する)の両方で評価される。
  • モデルは事前に訓練されたトランスフォーマー・アーキテクチャを活用し、汚染済み例に対してマスク言語モデルの目的関数を用いて訓練される。
  • CNN/DailyMailおよびK2019データセットを用いて、実要約生成出力への適合性をテストし、信頼性および正確性について人間による評価を実施。

実験結果

リサーチクエスチョン

  • RQ1ニューラルポストエディティング補正モデルは、要約生成モデルが生成した要約における事実誤認を効果的に特定・是正できるか?
  • RQ2人工的誤りで訓練された補正モデルは、要約生成モデルの出力における現実世界の事実的一致性の欠如に一般化してうまく機能するか?
  • RQ3補正モデルは、要約生成出力の信頼できる事実的一致性評価者として、どの程度の役割を果たせるか?
  • RQ4事実的に正しい要約に対して、補正の正確性と不必要な変更との間のトレードオフはどの程度か?
  • RQ5人工的誤りと現実世界の誤り補正設定との間で、性能ギャップが非常に大きいのはなぜか?

主な発見

  • 人工テストセットでは、補正モデルがヒューリスティックに汚染された要約の62.13%を正しく修正し、リファレンスに一致させた。
  • K2019の現実世界テストセットでは、62個の不一致要約のうち11個が正しく修正され、17.74%の補正率を達成した。
  • 441個の一致する要約のうち5個で誤った編集が行われ、偽陽性率は1.13%にとどまり、正しい要約に対する高い信頼性を示した。
  • 実要約におけるモデルのパフォーマンスは、人工データにおけるパフォーマンスより顕著に低いことから、合成誤りと現実の事実誤認の間で分布のずれが生じていることが示唆された。
  • K2019データセットにおいて、BERTやFactCCを上回る事実的一致性評価性能を示し、評価ツールとしての有効性を裏付けた。
  • 人間評価により、補正モデルが事実的一致性の誤りを信頼性高く是正でき、すでに正しい要約に対しては有害な編集を最小限に抑えることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。