Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Extractive Summarization by Pre-training Hierarchical Transformers

Shusheng Xu, Xingxing Zhang|arXiv (Cornell University)|Oct 16, 2020
Topic Modeling参考文献 53被引用数 5
ひとこと要約

この論文では、事前学習済み階層的トランスフォーマーからの文レベル自己注意機構を活用して、ラベル付き要約を必要とせずに重要文をランク付けする、新しい非教師付き抽出要約手法STASを提案する。文のシャッフル事前学習目的を導入することで、文の位置依存性を低減し、CNN/DailyMailおよびNYTデータセットで最先端のROUGEスコアを達成した。

ABSTRACT

Unsupervised extractive document summarization aims to select important sentences from a document without using labeled summaries during training. Existing methods are mostly graph-based with sentences as nodes and edge weights measured by sentence similarities. In this work, we find that transformer attentions can be used to rank sentences for unsupervised extractive summarization. Specifically, we first pre-train a hierarchical transformer model using unlabeled documents only. Then we propose a method to rank sentences using sentence-level self-attentions and pre-training objectives. Experiments on CNN/DailyMail and New York Times datasets show our model achieves state-of-the-art performance on unsupervised summarization. We also find in experiments that our model is less dependent on sentence positions. When using a linear combination of our model and a recent unsupervised model explicitly modeling sentence positions, we obtain even better results.

研究の動機と目的

  • 訓練中にラベル付き要約を必要としない非教師付き抽出要約手法の開発。
  • 階層的トランスフォーマーにおける文レベル自己注意機構が、グラフベース手法や汎用文埋め込みを用いずに、文の重要度を効果的にランク付けできるかの調査。
  • 文のシャッフル事前学習タスクを導入することで、抽出要約における文の位置依存性を低減すること。
  • 監視なしで標準的な非教師付き要約ベンチマークで最先端のパフォーマンスを達成すること。

提案手法

  • マスク文予測および文のシャッフルという2つの新しい事前学習タスクを用いて、大規模なラベルなしドキュメント上で階層的トランスフォーマー(拡張HIBERT)を事前学習する。
  • 事前学習済みモデルの文レベル自己注意スコアを、抽出要約における文の重要度の代理として使用する。
  • 他の文からの注意スコアの合計(すなわち、文iへの注意)に基づいて文をランク付けし、事前学習目的を組み込んで重要度推定を最適化する。
  • 事前学習中に文のシャッフルタスクを導入することで、モデルが内容に注目するよう促進する。
  • 最終的な文の重要度スコアと位置に敏感なモデルの線形結合を組み合わせることで、さらなるパフォーマンス向上を図る。
  • 学習済み重要度スコアに基づいて上位k個の文を選択することで、抽出要約に本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1階層的トランスフォーマーにおける文レベル自己注意機構は、非教師付き抽出要約の文の重要度ランク付けに効果的に利用できるか?
  • RQ2文のシャッフル事前学習目的を用いることで、要約におけるモデルの文の位置依存性が低下するか?
  • RQ3提案手法のパフォーマンスは、標準的なベンチマークで既存の非教師付き抽出要約モデルと比較してどうなるか?
  • RQ4本手法と位置に敏感なモデルを組み合わせることで、要約パフォーマンスがさらに向上するか?

主な発見

  • 提案されたSTASモデルは、CNN/DailyMailデータセットで最先端のROUGEスコアを達成し、テストセットにおいてROUGE-1、ROUGE-2、ROUGE-Lスコアがそれぞれ40.90、18.02、37.21を記録した。
  • ニューヨーク・タイムズデータセットでは、競争力あるパフォーマンスを発揮し、ROUGEおよび文の位置分布類似度の両面で、以前の非教師付き手法を上回った。
  • STASの文の位置分布は、他のモデルと比較してORACLE上界に著しく近い結果を示し、Kullback-Leibler発散は0.098であったのに対し、PACSUMでは0.614であった。
  • 文のシャッフル事前学習タスクを削除すると、位置バイアスが増加し、KL発散が0.108に上昇した。これは、位置依存性低減に本タスクの有効性を確認する結果となった。
  • STASと最近の位置に敏感なモデルの線形結合により、さらなる性能向上が達成された。これは、コンテンツベースと位置ベースのモデルの相補的な強みを示している。
  • 文のシャッフルタスクは、位置埋め込みを削除するなど単純な代替手法よりも優れた性能を示し、有用な位置インダクティブバイアスを保持しながら位置バイアスを低減する独自の能力を持つことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。