Skip to main content
QUICK REVIEW

[論文レビュー] Generating Representative Headlines for News Stories

Xiaotao Gu, Yuning Mao|arXiv (Cornell University)|Jan 26, 2020
Topic Modeling参考文献 59被引用数 7
ひとこと要約

本稿では、人為的アノテーションデータを一切用いずに、遠隔教師あり学習と多段階事前学習を活用して代表的な見出しを生成する神経見出し生成モデルNHNetを提案する。自己投票ベースの記事アテンション機構を導入することで、複数の記事に共通する情報を効果的に捉え、クリーンなデータセットおよびノイズの多いデータセットの両方でベースラインを上回り、高価な人為的アノテーションへの依存度を低減する。

ABSTRACT

Millions of news articles are published online every day, which can be overwhelming for readers to follow. Grouping articles that are reporting the same event into news stories is a common way of assisting readers in their news consumption. However, it remains a challenging research problem to efficiently and effectively generate a representative headline for each story. Automatic summarization of a document set has been studied for decades, while few studies have focused on generating representative headlines for a set of articles. Unlike summaries, which aim to capture most information with least redundancy, headlines aim to capture information jointly shared by the story articles in short length, and exclude information that is too specific to each individual article. In this work, we study the problem of generating representative headlines for news stories. We develop a distant supervision approach to train large-scale generation models without any human annotation. This approach centers on two technical components. First, we propose a multi-level pre-training framework that incorporates massive unlabeled corpus with different quality-vs.-quantity balance at different levels. We show that models trained within this framework outperform those trained with pure human curated corpus. Second, we propose a novel self-voting-based article attention layer to extract salient information shared by multiple articles. We show that models that incorporate this layer are robust to potential noises in news stories and outperform existing baselines with or without noises. We can further enhance our model by incorporating human labels, and we show our distant supervision approach significantly reduces the demand on labeled data.

研究の動機と目的

  • 複数の記事が同じ出来事について報じるニュースストーリーに対して、要約的で代表的な見出しを生成する課題に対処すること。
  • 人為的アノテーションデータに依存するコストを減らすために、遠隔教師あり学習アプローチを導入すること。
  • 記事内のノイズや一貫性のない内容に対してモデルのロバスト性を高めるために、自己投票ベースの記事アテンション機構を設計すること。
  • 367,000件のストーリーを含む手作業で整備された初のデータセットNewSHeadをリリースすることで、複数文書見出し生成のための新しいベンチマークを確立すること。
  • ラベルなしコーパスの品質と量のバランスを取る多段階事前学習フレームワークを用いて、モデル性能を向上させること。

提案手法

  • ストーリークラスタ内の最も代表的な記事タイトルを代理見出しとして用いる遠隔教師あり学習手法を提案し、人為的アノテーション見出しの必要性を排除する。
  • 異なる品質と量のラベルなしコーパスを統合する多段階事前学習フレームワークを導入し、人為的データを超える汎化性能を向上させる。
  • 記事間の関連性を投票メカニズムでモデル化することで、複数の記事に共通する顕著な内容をアテンション層が集約する自己投票ベースの記事アテンションレイヤーを設計する。
  • 遠隔教師あり学習データで微調整されたTransformerベースのエンコーダ・デコーダアーキテクチャを採用し、自己投票アテンションレイヤーが共通するストーリー水準の情報を強調する。
  • 遠隔教師あり学習データと少量の人為的アノテーションラベルを組み合わせることで、さらに性能を向上させ、データ効率性を示す。
  • 367,000件のニュースストーリー(1ストーリーあたり3〜5記事)を含むNewSHeadベンチマークを評価に活用し、既存手法と厳密な比較を可能にする。
Figure 1. An example of automatically generated story headline for articles about “Raptors vs. Bucks”.
Figure 1. An example of automatically generated story headline for articles about “Raptors vs. Bucks”.

実験結果

リサーチクエスチョン

  • RQ1人為的アノテーション見出しを一切用いずに、遠隔教師あり学習アプローチが見出し生成のための学習データを効果的に生成できるか。
  • RQ2多様なラベルなしコーパスを用いた多段階事前学習は、人為的データに限定して学習する場合と比較して、見出し生成性能をどのように向上させるか。
  • RQ3自己投票ベースの記事アテンション機構は、ノイズが多いまたは一貫性のない記事コンテンツに対して、どの程度モデルのロバスト性を向上させるか。
  • RQ4提案モデルはクリーンなデータセットおよびノイズの多いデータセットの両方でどのように性能を発揮するか。また、データ品質の異なる環境における汎化能力はいかがなものか。
  • RQ5大規模な遠隔教師あり学習データと少量の人為的アノテーションラベルを統合することで、モデル性能が顕著に向上するか。

主な発見

  • 提案された遠隔教師あり学習アプローチにより、従来の最大の複数文書要約データセットよりも6倍大きなデータセットで学習が可能となり、人為的アノテーションデータへの依存度が顕著に低減された。
  • 人為的データに限定して学習するモデルと比較して、多段階事前学習フレームワークで学習したモデルは、高量で低品質なラベルなしデータを組み込むことで、性能が向上していることが示された。
  • 自己投票ベースの記事アテンション機構により、モデルのロバスト性が向上し、クリーンなデータセットおよびノイズの多いデータセットの両方でベースラインモデルを上回る優れた性能を達成した。
  • NHNetはNewSHeadベンチマークで最先端の結果を達成し、ROUGEスコアおよび人間評価指標の両方で既存手法を上回った。
  • 少量の人為的アノテーションラベルを微調整に組み込むことで、さらに性能が向上した。これは、遠隔教師あり学習データが、下流タスクへの適応に効果的にモデルを事前学習していることを示している。
  • 367,000件のニュースストーリーを含む手作業で整備されたNewSHeadのリリースにより、複数文書見出し生成のための最初の包括的ベンチマークが提供され、今後の研究と評価を可能にした。
(a) Topic Distribution
(a) Topic Distribution

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。