Skip to main content
QUICK REVIEW

[論文レビュー] Ranking Sentences for Extractive Summarization with Reinforcement Learning

Shashi Narayan, Shay B. Cohen|arXiv (Cornell University)|Feb 23, 2018
Topic Modeling被引用数 6
ひとこと要約

この論文では、ROUGE評価指標を直接最適化する強化学習ベースの文順序付けモデルを提案し、自動評価および人間評価の両方で、CNN/DailyMailデータセットにおいて最先端の抽出的および要約的モデルを上回ることを示した。ポリシー勾配とROUGEに基づく報酬を用いて、階層的ニューラルネットワークを訓練し、文の抽出価値を順序付けすることで、交差エントロピーで訓練されたベースラインと比較して、より簡潔で情報量が多く、滑らかな要約を生成した。

ABSTRACT

Single document summarization is the task of producing a shorter version of a document while preserving its principal information content. In this paper we conceptualize extractive summarization as a sentence ranking task and propose a novel training algorithm which globally optimizes the ROUGE evaluation metric through a reinforcement learning objective. We use our algorithm to train a neural summarization model on the CNN and DailyMail datasets and demonstrate experimentally that it outperforms state-of-the-art extractive and abstractive systems when evaluated automatically and by humans.

研究の動機と目的

  • 抽出的要約における標準的な交差エントロピー学習とROUGE評価指標との間の不一致を解消すること。
  • 強化学習を用いてROUGEをグローバルに最適化することで要約品質を向上させること。
  • グローバルに最適化された抽出的モデルが、情報量と包括性において要約的モデルを上回ることを示すこと。
  • ポリシー勾配強化学習による文順序付けが、より簡潔で情報量の多い要約を生成することを示すこと。
  • 大規模な人間評価を通じて、抽出的および要約的システムを比較し、手法の有効性を検証すること。

提案手法

  • 文の抽出価値をスコアリングするため、ドキュメントエンコーダーと文抽出器を備えた階層的エンコーダ-デコーダアーキテクチャを採用する。
  • REINFORCEアルゴリズムを用いて、最大尤度の交差エントロピー損失とポリシー勾配目的を組み合わせる。
  • 報酬関数は、候補要約と正解要約の間のROUGEスコアに基づき、文順序付けに向けた密度の高いフィードバックを提供する。
  • 候補要約は上位順にスコアの高い文を選択することで作成され、モデルはポリシー勾配により高ROUGE選択の確率を高めるように更新される。
  • 訓練プロセスでは、高スコアの要約に頻繁に現れる文を順序付けることを学習する、候補要約の空間を探索する。
  • 文脈的特徴や手動のヒューリスティクスに依存せず、データから直接連続的表現を学習する。

実験結果

リサーチクエスチョン

  • RQ1ROUGEに基づく報酬を用いた強化学習は、交差エントロピー学習を上回る抽出的要約性能を実現できるか?
  • RQ2ROUGE指標をグローバルに最適化することで、標準的な学習目的に比べて情報量が多く、より簡潔な要約が得られるか?
  • RQ3人間評価において、グローバルに最適化された抽出的モデルは、最先端の要約的モデルと比べてどうか?
  • RQ4ポリシー勾配による学習で順序付けられた文順序付けモデルは、標準ベンチマークで既存の抽出的および要約的システムを上回れるか?
  • RQ5人間がアノテートした評価において、モデルは元のドキュメントの重要な情報をどの程度保持しているか?

主な発見

  • 提案手法は、CNNおよびDailyMailデータセットにおいて、自動ROUGE評価で最先端の抽出的および要約的モデルを上回った。
  • 人間評価では、情報量と包括性の観点から、要約的システムが出力する要約よりも、本手法が生成する要約が好まれた。
  • 交差エントロピーで訓練されたモデルと比較して、本手法は冗長性が低く、より簡潔な要約を生成した。
  • 強化学習の目的関数は、モデルの文順序付けをROUGE指標と整合させることに成功し、要約全体の品質向上に寄与した。
  • 結果から、柔軟性に優れる要約的モデルであっても、人間による評価では一貫して抽出的モデルを上回るとは限らないことが示された。
  • 強化学習による評価指標の直接最適化が、抽出的要約において有効であることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。