Skip to main content
QUICK REVIEW

[論文レビュー] Effective extractive summarization using frequency-filtered entity relationship graphs

Archit Sakhadeo, Nisheeth Srivastava|arXiv (Cornell University)|Oct 24, 2018
Topic Modeling参考文献 12被引用数 4
ひとこと要約

本稿では、語の頻度に基づくキーワード特定と、頻度フィルタリングを施したエンティティ関係グラフを組み合わせることで、要約の情報量と一貫性を向上させるハイブリッド抽出要約手法を提案する。文の構造(主語-動詞-目的語)を活用してエンティティグラフを構築し、キーワード頻度に基づくフィルタリングを施すことで、DUC 2002 において TextRank よりも ROUGE-1 F スコアで 7.93% 高く、ROUGE-1 リcall で 17.12% 高く、また人間の評価者よりも人間らしさが高く評価された。

ABSTRACT

Word frequency-based methods for extractive summarization are easy to implement and yield reasonable results across languages. However, they have significant limitations - they ignore the role of context, they offer uneven coverage of topics in a document, and sometimes are disjointed and hard to read. We use a simple premise from linguistic typology - that English sentences are complete descriptors of potential interactions between entities, usually in the order subject-verb-object - to address a subset of these difficulties. We have developed a hybrid model of extractive summarization that combines word-frequency based keyword identification with information from automatically generated entity relationship graphs to select sentences for summaries. Comparative evaluation with word-frequency and topic word-based methods shows that the proposed method is competitive by conventional ROUGE standards, and yields moderately more informative summaries on average, as assessed by a large panel (N=94) of human raters.

研究の動機と目的

  • 純粋な頻度ベースおよびグラフベースの抽出要約手法に見られる、文脈カバレッジの不足や一貫性の欠如といった限界を解消すること。
  • 言語的構造をエンティティ関係グラフに統合することで、要約の情報量と一貫性を向上させること。
  • 事前に整備されたオントロジーに依存するのを減らし、文の構造から自動的にエンティティ関係を抽出すること。
  • ROUGE スコアと人間評価の両方を用いて包括的に評価することで、要約品質のバランスの取れた視点を得ること。
  • キーワード頻度に基づいてエンティティ関係をフィルタリングすることで、要約の関連性とカバレッジが向上することを示すこと。

提案手法

  • コアファレンス解決を併用したオープン情報抽出(OpenIE)を用いて、文から候補となる主語-動詞-目的語の三項対を抽出する。
  • ノードをエンティティ、エッジをそれらの間の関係とするエンティティ関係グラフを構築する。
  • ドキュメントに含まれる高頻度キーワードを含むエンティティ関係のみを保持することで、頻度フィルタリングを適用する。
  • 各文が含むフィルタリング済みの高頻度エンティティ関係の数に基づいて、文をランク付けする。
  • 上位ランクの文を選別して最終的な抽出要約を構成する。文の長さによるバイアスを軽減するため、文の長さに応じた正規化処理をオプションで適用可能。
  • キーワード頻度とグラフの中心性を組み合わせたハイブリッドスコアリング機構を用い、意味的に関連性が高く、かつ良好に接続された文を優先順位付けする。

実験結果

リサーチクエスチョン

  • RQ1キーワード頻度とエンティティ関係グラフを組み合わせることで、純粋な頻度ベースやグラフベースのベースラインを上回る抽出要約が可能になるか?
  • RQ2キーワード頻度に基づいてエンティティ関係をフィルタリングすることで、要約のカバレッジと一貫性が向上するか?
  • RQ3標準的な ROUGE スコアと人間評価の両方において、提案手法は最先端の抽出要約手法を上回るか?
  • RQ4この手法が、人間が作成した要約と区別がつかないような要約を生成する程度はどの程度か?
  • RQ5ROUGE スコアを維持または向上させつつ、文の長さに偏ったバイアスを低減できるか?

主な発見

  • 正規化を施した後、DUC 2002 データセットにおいて、本手法は TextRank よりも ROUGE-1 F スコアで 7.93% 高く、ROUGE-1 リcall で 17.12% 高かった。
  • 本手法は、TextRank や LexRank といった古典的手法に加え、McDonald (2007) や Gillick and Favre (2009) といった最近の手法に対しても、ROUGE スコアで優位性を示した。
  • 人間の評価者は、本手法による要約を、ベースライン手法の要約よりも情報量が多く、一貫性があると評価し、人間が作成したものと誤認される可能性が高かった。
  • フィルタリング機構により、文脈的に重要な関係が保持されるため、特に短い要約においても、関連するコンテンツのカバレッジが優れていた。
  • ROUGE スコアと人間評価の両方の結果から、トピックに関連する内容を捉える能力が著しく向上し、冗長性も低減されたことが示された。
  • 著者らは、文の長さの正規化をさらに適用することで、精度が向上する可能性があると特定し、今後の最適化のための有望な方向性であると示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。