Skip to main content
QUICK REVIEW

[論文レビュー] An Entity-Driven Framework for Abstractive Summarization

Eva Sharma, Luyang Huang|arXiv (Cornell University)|Sep 4, 2019
Topic Modeling参考文献 45被引用数 8
ひとこと要約

本論文では、エンティティに配慮したコンテンツ選択と強化学習を用いて、より一貫性があり、簡潔で、事実に忠実な要約を生成する二段階のニューラル抽象要約フレームワーク、SENECAを提案する。顕著なエンティティと言語的インセンティブに基づく報酬を活用することで、SENECAはCNN/Daily MailおよびNew York Timesデータセットにおいて、一貫性と情報量の面で人間評価において先行モデルを上回り、最新のROUGEスコアを達成した。

ABSTRACT

Abstractive summarization systems aim to produce more coherent and concise summaries than their extractive counterparts. Popular neural models have achieved impressive results for single-document summarization, yet their outputs are often incoherent and unfaithful to the input. In this paper, we introduce SENECA, a novel System for ENtity-drivEn Coherent Abstractive summarization framework that leverages entity information to generate informative and coherent abstracts. Our framework takes a two-step approach: (1) an entity-aware content selection module first identifies salient sentences from the input, then (2) an abstract generation module conducts cross-sentence information compression and abstraction to generate the final summary, which is trained with rewards to promote coherence, conciseness, and clarity. The two components are further connected using reinforcement learning. Automatic evaluation shows that our model significantly outperforms previous state-of-the-art on ROUGE and our proposed coherence measures on New York Times and CNN/Daily Mail datasets. Human judges further rate our system summaries as more informative and coherent than those by popular summarization models.

研究の動機と目的

  • ニューラル抽象要約モデルにおける一貫性の欠如と事実の不一致を解消すること。
  • 入力テキスト内の顕著なエンティティとその話法的役割をモデル化することで、要約の情報量と一貫性を向上させること。
  • コンテンツ選択と抽象化を分離することで、制御性と品質を高める二段階のフレームワークを開発すること。
  • 一貫性、簡潔さ、明確さに焦点を当てた言語的インセンティブ報酬を強化学習の訓練に組み込み、抽象生成を改善すること。
  • エンティティベースのモデリングが、事実の忠実性と話法的レベルの一貫性の両方を向上させることを実証すること。

提案手法

  • フレームワークは、エンティティの顕著性と文脈的関連性に基づいて顕著な文を特定するエンティティに配慮したコンテンツセレクタを使用する。
  • 抽象生成器は、ポインタジェネレータ注意を備えたシーケンス・トゥ・シーケンスモデルを用いて、文間の情報圧縮と抽象化を実行する。
  • 強化学習により抽象生成器を訓練し、ROUGEスコアに加えて一貫性、簡潔さ、明確さの報酬を組み合わせた報酬関数を用いる。
  • コンテンツセレクタと抽象生成器は強化学習により共同最適化され、ポリシー勾配を用いたエンド・ツー・エンドの訓練が可能になる。
  • 文の順序付けと代名詞の使用を改善するため、エンティティ遷移と共参照パターンをモデル化する。
  • 自然な言語パターン(代名詞の使用、エンティティチェーンの維持など)を促進する言語的インセンティブ報酬を設計する。

実験結果

リサーチクエスチョン

  • RQ1エンティティに配慮したコンテンツ選択は、抽象要約の情報量と一貫性を向上させることができるか?
  • RQ2エンティティベースの話法的モデリングを統合することで、要約の一貫性と事実の忠実性はどのように変化するか?
  • RQ3ROUGEベースの最適化を超えて、言語的動機付けの報酬を用いた強化学習は、要約品質を向上させることができるか?
  • RQ4二段階フレームワークは、エンド・ツー・エンドの抽象モデルに比べ、一貫性があり簡潔な要約を生成する上で優れているか?
  • RQ5人間評価者は、最先端モデルと比較して、エンティティ駆動型の抽象要約を、より一貫性があり情報量が多いと評価するか?

主な発見

  • SENECAは、CNN/Daily MailおよびNew York Timesの両データセットで、最新のROUGEスコアを達成し、先行手法を顕著に上回った。
  • 人間評価では、DeepReinforce や PointGen などの人気モデルと比較して、SENECAが生成する要約がより一貫性があり情報量が多いと評価された。
  • 一貫性報酬を追加したモデル(SENECA + R_coh)は、構造と内容の両面で人間の基準要約に最も近い要約を生成した。
  • 自動評価では、一貫性測定値に顕著な向上が見られ、より良い話法的構成が実現した。
  • エンティティ遷移と共参照モデリングを活用することで、より自然な代名詞の使用と要約内の冗長性の低減が達成された。
  • ROUGE、一貫性、簡潔さ、明確さの複数目的報酬を用いた強化学習により、より滑らかで文脈的に一貫性のある要約が生成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。