Skip to main content
QUICK REVIEW

[論文レビュー] BIGPATENT: A Large-Scale Dataset for Abstractive and Coherent Summarization

Eva Sharma, Chen Li|arXiv (Cornell University)|Jun 10, 2019
Topic Modeling参考文献 31被引用数 20
ひとこと要約

本稿では、130万件の米国特許出願文書と人間が作成した要約を含む大規模データセットBigPatentを紹介する。既存のニュースベースの要約データセットに見られる平坦化された話法構造、均一でない重要情報の分布、および高い抽出的要約の割合といった制限を克服することを目的としている。ニュース要約とは異なり、BigPatentはより一貫性のある話法的構造、均等に分散された重要情報、および少ない抽出的断片を特徴とし、要約生成におけるグローバルな内容理解と話法計画の向上を可能にする。

ABSTRACT

Most existing text summarization datasets are compiled from the news domain, where summaries have a flattened discourse structure. In such datasets, summary-worthy content often appears in the beginning of input articles. Moreover, large segments from input articles are present verbatim in their respective summaries. These issues impede the learning and evaluation of systems that can understand an article's global content structure as well as produce abstractive summaries with high compression ratio. In this work, we present a novel dataset, BIGPATENT, consisting of 1.3 million records of U.S. patent documents along with human written abstractive summaries. Compared to existing summarization datasets, BIGPATENT has the following properties: i) summaries contain a richer discourse structure with more recurring entities, ii) salient content is evenly distributed in the input, and iii) lesser and shorter extractive fragments are present in the summaries. Finally, we train and evaluate baselines and popular learning models on BIGPATENT to shed light on new challenges and motivate future directions for summarization research.

研究の動機と目的

  • 既存のテキスト要約データセットの制限を解消すること。これらは主にニュースベースであり、平坦化された話法的構造、均一でない重要情報の分布、および高い抽出的コンテンツの含有を示している。
  • 大規模かつ高品質なデータセットを構築し、より優れたグローバルな内容モデリングと話法認識を備えた要約生成モデルの学習と評価を可能にする。
  • 抽出的断片への依存を減らし、エンティティの一貫性を向上させることで、より一貫性があり要約的である要約を生成するシステムの構築を促進する。
  • 既存のモデルをBigPatent上でベンチマーク化し、特に話法的構造の処理や幻覚・繰り返しの回避において現在のニューラル要約モデルの欠陥を明らかにする。

提案手法

  • 米国特許商標局(USPTO)データベースから、人間が作成した要約を含む130万件の米国特許出願文書を収集した。
  • 入力文書全体にわたり重要情報が均等に分布するようデータセットを設計し、初期部に集中するのを回避した。
  • フレーズをそのままでコピーするのを避けるよう要約作成を促進することで、抽出的断片を最小限に抑えた。
  • 話法認識型のアノテーションを採用し、要約内で繰り返し現れるエンティティや複雑な文レベルの構造を促進した。
  • BigPatent上で複数の抽出的および要約的モデル(例:Lead-3、TextRank、Seq2Seq、Pointer-Generator、SentRewriting)を訓練・評価し、CNN/DMおよびNYTのベンチマークと性能を比較した。
  • ROUGEスコアと新規のn-gram/エンティティ頻度分析を用いて、要約の抽象的品質を評価し、幻覚や繰り返しを検出した。

実験結果

リサーチクエスチョン

  • RQ1既存の要約的生成モデルは、標準的なニュースベンチマークと比較して、BigPatentのような大規模で話法的構造が豊富な非ニュース文書データセット上で、どのように性能を発揮するか?
  • RQ2現在のモデルは、複雑な技術的文書における要約において、どの程度抽出的断片を減らし、話法的一致性を維持しているか?
  • RQ3生成された要約におけるエンティティの繰り返しパターンは、人間の基準要約と比較してどのように異なるか? これはモデルの話法的構造と重要情報の理解度を何を示唆するか?
  • RQ4重要情報が均等に分散されており、技術的構造が複雑な文書から要約的生成を行う際の主な課題は何か?
  • RQ5強化学習ベースのモデル(例:SentRewriting)は、BigPatent上で標準的なseq2seqモデルを上回る性能を示すか? これは要約的生成における最適化目的に関する何を示唆するか?

主な発見

  • すべてのモデルがBigPatentでCNN/DMおよびNYTよりも低いROUGEスコアを達成した。これは、BigPatentが要約モデルにとってより挑戦的なベンチマークであることを示している。
  • TextRank や LexRank といった抽出的モデルが、RNN-ext RL よりもBigPatentで優れた性能を示した。これは、局所的特徴に依存するモデルが、より長く複雑な入力に対しては苦戦することを示している。
  • 最も高いROUGEスコアを記録したモデル、SentRewritingは、ROUGEに基づく報酬を用いた強化学習の恩恵を示した。
  • 神経的要約的モデル、特にSeq2SeqおよびPointGenは、人間の要約(>3回繰り返し:4.0%)と比較して、著しく高いエンティティの繰り返し率(>3回:22.6%)を示した。これは、話法レベルの計画が不十分であることを示している。
  • unigramの新規n-gramの割合(例:18.6%)は、人間要約と同等であったが、Seq2SeqおよびPointGenは「上部はソール部の上部を受けるように構成されている」といった架空または重複する内容を生成した。これは幻覚の問題を示している。
  • PointGen + cov におけるカバレッジ機構は、エンティティの繰り返し率(>3回:1.2%)を人間要約レベル(4.0%)に近づけた。これは明示的な正則化が繰り返しを緩和するが、意味的理解のギャップを完全に解消しないことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。