Skip to main content
QUICK REVIEW

[論文レビュー] AREDSUM: Adaptive Redundancy-Aware Iterative Sentence Ranking for Extractive Document Summarization

Keping Bi, Rahul Jha|arXiv (Cornell University)|Apr 13, 2020
Topic Modeling参考文献 35被引用数 5
ひとこと要約

本稿では、抽出的要約のための2段階で適応的で冗長性を考慮した反復的文順序ランク付けモデル、ARedSum-Ctxを提案する。まず文の重要度をスコア付けし、次にn-gram重複や意味的一致スコアなどの表面特徴を用いて重要度と冗長性のバランスを学習する。CNN/DailyMailおよびNYT50において、連合モデリング(ARedSum-Seq)およびヒューリスティックベースの冗長性除去(例:Trigram Blocking)を著しく上回り、ROUGEスコアをSOTA水準にまで向上させつつ、精度を向上させ、冗長性を低減した。これは、冗長性を明示的かつ別個にモデリングすることで、連合最適化よりも優れた要約品質が得られることを示している。

ABSTRACT

Redundancy-aware extractive summarization systems score the redundancy of the sentences to be included in a summary either jointly with their salience information or separately as an additional sentence scoring step. Previous work shows the efficacy of jointly scoring and selecting sentences with neural sequence generation models. It is, however, not well-understood if the gain is due to better encoding techniques or better redundancy reduction approaches. Similarly, the contribution of salience versus diversity components on the created summary is not studied well. Building on the state-of-the-art encoding methods for summarization, we present two adaptive learning models: AREDSUM-SEQ that jointly considers salience and novelty during sentence selection; and a two-step AREDSUM-CTX that scores salience first, then learns to balance salience and redundancy, enabling the measurement of the impact of each aspect. Empirical results on CNN/DailyMail and NYT50 datasets show that by modeling diversity explicitly in a separate step, AREDSUM-CTX achieves significantly better performance than AREDSUM-SEQ as well as state-of-the-art extractive summarization baselines.

研究の動機と目的

  • 連合的最重要度・冗長性モデリングによる要約性能の向上が、より良い符号化に起因するのか、それともより良い冗長性処理に起因するのかを調査すること。
  • 反復的文選択において、最重要度と冗長性のスコア付けを分離するアプローチと両者を連合最適化するアプローチの効果を評価すること。
  • 重要度と冗長性のバランスを明示的に最適化する2段階の適応的学習モデルを設計・検証し、要約品質の向上を図ること。
  • 抽出的要約におけるヒューリスティックベースの冗長性除去(例:Trigram Blocking)と学習された適応的冗長性モデリングの有効性を比較すること。

提案手法

  • ARedSum-Seqは、変換器ベースの条件付き文順序生成器を用い、以前に選択された文との相対的な重要度と新規性に基づいて、文を同時にスコア付け・選択する。
  • ARedSum-Ctxは2段階のアプローチを採用する:まず、BERTベースのエンコーダーを用いて重要度をスコア付けする。次に、n-gram重複や意味的一致スコアなどの表面特徴を用いて、重要度と冗長性のバランスを学習する。
  • ARedSum-Ctxにおける冗長性部は、ペairワイズ順序付け目的関数を介して学習され、以前に選択された文を前提としたROUGEスコアの向上を最適化することで、冗長だが重要なコンテンツの適応的フィルタリングを可能にする。
  • モデルは、ゴール要約からの教師信号を用いて、CNN/DailyMailおよびNYT50でエンドツーエンドに訓練され、グリーディデコードプロセスを模倣する反復的選択が行われる。
  • 表面特徴として、3-gram重複率やBERTベースの意味的類似度が、ARedSum-Ctxの2段階目の冗長性の定量的評価に用いられる。
  • 本手法は、Trigram Blockingを併用したBertSumExtや、他のSOTA抽出的モデルを含む強力なベースラインと比較されている。

実験結果

リサーチクエスチョン

  • RQ1重要度と冗長性の両者を1つのシーケンス生成モデルで連合最適化するのではなく、別段階で冗長性を明示的にモデリングすることで、より優れた要約性能が得られるか?
  • RQ2学習された冗長性モデル(ARedSum-Ctx)は、ヒューリスティックベースの冗長性除去(例:Trigram Blocking)と比較して、ROUGEスコアおよび精度の面でどのように異なるか?
  • RQ3重要度と冗長性のスコア付けを分離することで、要約の情報量と冗長性のバランスがどの程度向上するか?
  • RQ4重要度と冗長性のバランスを学習する2段階モデルは、異なるドキュメントに適応的に対応でき、連合モデリングよりも優れた一般化性能を達成できるか?
  • RQ5自動評価および人的評価で測定した要約品質を決定づける要因として、重要度と冗長性低減の相対的寄与度はどの程度か?

主な発見

  • ARedSum-Ctxは、CNN/DailyMailおよびNYT50の両方でSOTA性能を達成し、ROUGE-1、ROUGE-2、ROUGE-LスコアにおいてARedSum-Seqおよびすべての強力なベースラインを上回った。
  • CNN/DailyMailでは、ARedSum-CtxはROUGE-Lスコア43.8を達成し、BertSumExt + TriBlk(42.5)およびARedSum-Seq(42.1)を著しく上回り、人的評価でもp値 < 0.0001であった。
  • 人的評価では、ARedSum-Ctxは全体的な品質(p < 0.03)および冗長性(p < 0.03)の両面でBertSumExt + TriBlkを著しく上回った。これは、優れた冗長性制御能力を示している。
  • ARedSum-Ctxは、冗長性を低減しながらも高い精度(P@1 = 0.58、P@2 = 0.62、P@3 = 0.64)を維持している。一方、Trigram BlockingはROUGEスコアを向上させるが、精度を損なう傾向にあった。
  • 文の位置分析では、ARedSum-Ctxはドキュメント全体にわたって文を選択する傾向にあり、初期の文に過度に依存しない。これに対してARedSum-Seqは最初の3文に集中する傾向にあった。
  • NYT50では、ARedSum-Ctxは冗長性の平均順位が1.00(BertSumExtは1.60)を記録し、p値 < 0.0001であった。これは、冗長コンテンツを優れた能力で低減できることを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。