Skip to main content
QUICK REVIEW

[論文レビュー] TED: A Pretrained Unsupervised Summarization Model with Theme Modeling and Denoising

Ziyi Yang, Chenguang Zhu|arXiv (Cornell University)|Jan 3, 2020
Topic Modeling参考文献 35被引用数 13
ひとこと要約

TEDは、2140万件のラベルなし記事を用いた大規模な事前学習ののち、トピックモデリングとノイズ除去オートエンコーダーを用いた微調整を行うことで、ニュース記事のリードバイアスを活用した事前学習・教師なし抽象的要約モデルである。CNN/DM、NYT、Gigawordデータセットにおいて最先端の性能を達成し、参照要約を必要としないすべての先行教師なし抽象的要約モデルを上回る、非常に抽象的で流暢な要約を生成する。

ABSTRACT

Text summarization aims to extract essential information from a piece of text and transform the text into a concise version. Existing unsupervised abstractive summarization models leverage recurrent neural networks framework while the recently proposed transformer exhibits much more capability. Moreover, most of previous summarization models ignore abundant unlabeled corpora resources available for pretraining. In order to address these issues, we propose TED, a transformer-based unsupervised abstractive summarization system with pretraining on large-scale data. We first leverage the lead bias in news articles to pretrain the model on millions of unlabeled corpora. Next, we finetune TED on target domains through theme modeling and a denoising autoencoder to enhance the quality of generated summaries. Notably, TED outperforms all unsupervised abstractive baselines on NYT, CNN/DM and English Gigaword datasets with various document styles. Further analysis shows that the summaries generated by TED are highly abstractive, and each component in the objective function of TED is highly effective.

研究の動機と目的

  • 人為的参照要約を必要としない教師なし抽象的要約モデルの開発を目的とする。
  • ニュース記事に内在する構造的バイアス(特に、重要な情報を含む最初の段落)を活用し、人為的監視なしに大規模な事前学習を実現することを目的とする。
  • 入力記事と生成要約の意味的類似性を強制するトピックモデリング損失を用いて、要約品質の向上を図ることを目的とする。
  • 入力テキストにノイズ(例:マスキング、シャッフル)を加え、元のクリーンなテキストを再構築するように学習するノイズ除去オートエンコーダーを用いて、文の流暢さと耐性を向上させることを目的とする。
  • 大規模なラベルなしデータで事前学習したトランスフォーマー基盤モデルを、構造化された目的関数で微調整することで、教師ありベースラインを上回る性能を教師なし設定で達成できることを示すこと

提案手法

  • 最初の数文(リードパラグラフ)をターゲット要約として用い、2140万件のラベルなしニュース記事を用いてTEDを事前学習することで、自己教師あり学習による要約能力の習得を可能にする。
  • 長距離依存関係をモデル化し、抽象的要約を生成するために、トランスフォーマーのエンコーダ-デコーダアーキテクチャを採用する。
  • 入力記事と生成要約の間の意味的類似性を強制するため、識別的分類器を用いたトピックモデリングモジュールを導入する。
  • 要約生成におけるargmax演算の微分可能最適化を可能にするために、Gumbel-Softmax推定器を適用し、離散トークン生成のエンドツーエンド学習を実現する。
  • 入力テキストにノイズ(例:マスキング、シャッフル)を加え、元のテキストを再構築するように学習するノイズ除去オートエンコーダーを用い、耐性と流暢さを向上させる。
  • 事前学習、トピックモデリング、ノイズ除去の目的関数を組み合わせたマルチオブジェクティブ損失を用いて、ターゲットドメインでのモデル微調整を行う。

実験結果

リサーチクエスチョン

  • RQ1教師なし要約モデルとして、トランスフォーマー基盤のモデルが、参照要約が一切ない状態で強力な抽象的要約性能を達成できるか?
  • RQ2ニュース記事のリードバイアスを自己教師あり学習のための要約モデル事前学習に活用する効果はどの程度高いか?
  • RQ3トピックモデリングとノイズ除去オートエンコーダーは、生成要約の品質と抽象的性質をどの程度向上させるか?
  • RQ4完全に教師なしのモデルが、ゼロショット設定で既存の教師あり抽象的要約モデルを上回れるか?
  • RQ5目的関数の各構成要素が、最終的な要約性能にどの程度寄与しているか?

主な発見

  • TEDは、CNN/DM、NYT、英語Gigawordデータセットにおいて、最先端の性能を達成し、NYTデータセットでROUGE-1スコア37.78を記録。これにより、すべての先行教師なし抽象的要約モデルを上回った。
  • 大規模なラベルなしデータでの事前学習により、スクラッチからの学習に比べてROUGE-1スコアが10%以上向上した。これは、自己教師あり事前学習の有効性を示している。
  • トピックモデリングとノイズ除去損失の両方を備えた完全なモデルが、NYTデータセットで最高のROUGE-1(37.78)、ROUGE-2(17.63)、ROUGE-L(34.33)スコアを達成した。
  • TEDは、教師ありPGNetモデルと比較して、より多くの新しいn-gramを生成しており、これは教師なしであるにもかかわらず強力な抽象的要約能力を示している。
  • アブレーションスタディの結果、事前学習、トピックモデリング、ノイズ除去の各要素が顕著に寄与しており、それぞれがROUGEスコアに2%以上の向上をもたらした。
  • モデルは流暢で文法的に正しい要約を生成するが、イベントの時間的関係を誤って表現することが稀にある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。