Skip to main content
QUICK REVIEW

[論文レビュー] Pre-training for Abstractive Document Summarization by Reinstating Source Text

Yanyan Zou, Xingxing Zhang|arXiv (Cornell University)|Apr 4, 2020
Topic Modeling参考文献 47被引用数 4
ひとこと要約

本論文は、元のソースドキュメントを再構築することで、ラベルなしテキスト上で抽象的要約モデルを事前学習できる3つのシーケンス・ツー・シーケンス事前学習目的(文の再順序化、次の文生成、マスキングドキュメント生成)を提案する。19GBの事前学習データしか使用していないにもかかわらず、160GB以上のコーパスで事前学習されたモデルと同等またはそれ以上のROUGEスコアを達成しており、限られたデータでも高い有効性を示している。

ABSTRACT

Abstractive document summarization is usually modeled as a sequence-to-sequence (Seq2Seq) learning problem. Unfortunately, training large Seq2Seq based summarization models on limited supervised summarization data is challenging. This paper presents three pre-training objectives which allow us to pre-train a Seq2Seq based abstractive summarization model on unlabeled text. The main idea is that, given an input text artificially constructed from a document, a model is pre-trained to reinstate the original document. These objectives include sentence reordering, next sentence generation, and masked document generation, which have close relations with the abstractive document summarization task. Experiments on two benchmark summarization datasets (i.e., CNN/DailyMail and New York Times) show that all three objectives can improve performance upon baselines. Compared to models pre-trained on large-scale data (more than 160GB), our method, with only 19GB text for pre-training, achieves comparable results, which demonstrates its effectiveness.

研究の動機と目的

  • ラベルなしテキスト上で事前学習することで、限られた教師ありデータを用いた大規模抽象的要約モデルの学習課題を解決すること。
  • 要約の特徴の一つであるコンテンツ再順序化を明示的にモデル化する事前学習目的を設計すること。
  • シーケンス・ツー・シーケンスの目的関数を用いてラベルなしテキストで事前学習することで、抽象的要約におけるモデルの汎化性と性能を向上させること。
  • 現在の最先端モデルが使用するデータ量よりも著しく少ないデータ量で、抽象的要約のための効果的な事前学習が可能であることを示すこと。

提案手法

  • 文の再順序化(SR)、次の文生成(NSG)、マスキングドキュメント生成(MDG)の3つのシーケンス・ツー・シーケンス事前学習(STEP)目的を提案する。
  • 各目的は、シャッフルされた文、次に続くセグメントの予測、またはマスキングされたスパンといった、意図的に破損させたバージョンから元のソースドキュメントを再構築するようにseq2seqモデルを学習させる。
  • 要約データセットの学習スプリット(例:CNN/DailyMail、NYT)から得たラベルなしドキュメントでモデルを事前学習し、その後、教師あり要約タスクで微調整する。
  • 共有エンコーダ・デコーダ構造を有するトランスフォーマーに基づくseq2seqアーキテクチャを用い、マスク言語モデルとノイズ除去目的関数を用いて事前学習する。
  • 2段階の訓練パイプラインを採用:まずラベルなしデータでSTEP目的による事前学習を行い、その後、教師あり要約データで微調整する。
  • ROUGEと人間評価を用いて、ベンチマークデータセット上で個々のおよび組み合わせたSTEP目的の有効性を評価する。

実験結果

リサーチクエスチョン

  • RQ1元のテキストを再構築する手法を用いて、ラベルなしテキストで事前学習することで、抽象的要約性能が向上するか?
  • RQ2コンテンツ再順序化をモデル化するシーケンス・ツー・シーケンス事前学習目的は、要約品質を向上させるか?
  • RQ319GBのテキストでのみ事前学習したモデルが、160GB以上のデータで事前学習されたモデルと同等の性能を達成できるか?
  • RQ4自動評価および人間評価において、BERTAbs や UniLM といった強力なベースラインと比較して、提案手法のSTEPはどのように差をつけるか?
  • RQ5要約データセットの学習スプリットで事前学習しても、依然として汎化性能の向上が得られるか?

主な発見

  • 19GBのラベルなしテキストでのみ事前学習した本手法のSTEPは、CNN/DailyMailでROUGE-1、ROUGE-2、ROUGE-Lスコアが、160GB以上のデータで事前学習されたモデルと同等またはそれ以上を達成している。
  • 文の再順序化(SR)目的のみを用いても、同じ教師ありデータで微調整した強力なベースラインを上回る性能を示している。
  • 人間評価では、最良のSTEPモデルが23%のケースで最も高い順位にランク付けされ、他のすべてのモデル(人間レファレンスを除く)と比較して平均順位が顕著に低い(2.77)ことが確認された。
  • ProphetNet(16GB)やUniLM(16GB)といった16GBのテキストで事前学習されたモデルを上回っており、データ効率に優れていることが示された。
  • T5 や PEGASUS(HugeNews)よりもROUGE-1およびROUGE-Lスコアが高く、全体的な内容の捉え方や文の流れの自然さに優れているが、ROUGE-2ではわずかに劣っている。
  • 定性的な分析から、モデルが流暢で情報豊かで簡潔な要約を生成しており、しばしば元のソースの内容を再構成・再編集していることが確認され、抽象的要約の特徴を示していることが分かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。