Skip to main content
QUICK REVIEW

[論文レビュー] Robust Neural Abstractive Summarization Systems and Evaluation against Adversarial Information

Lisa Fan, Dong Yu|arXiv (Cornell University)|Oct 14, 2018
Topic Modeling参考文献 42被引用数 19
ひとこと要約

本稿では、意味解析と要約の共同学習により事実的整合性とロバスト性を向上させる意味的注意型ニューラル要約生成モデルを提案する。二重アテンションメカニズムとセグメントベースの再ランク付け戦略を用いることで、より忠実で重複の少ない要約を生成し、seq2seqおよびポインタジェネレーターモデルを自動評価および人的評価の両方で上回る。特にトピック外の挿入を伴う悪意ある条件下でも顕著な優位性を示す。

ABSTRACT

Sequence-to-sequence (seq2seq) neural models have been actively investigated for abstractive summarization. Nevertheless, existing neural abstractive systems frequently generate factually incorrect summaries and are vulnerable to adversarial information, suggesting a crucial lack of semantic understanding. In this paper, we propose a novel semantic-aware neural abstractive summarization model that learns to generate high quality summaries through semantic interpretation over salient content. A novel evaluation scheme with adversarial samples is introduced to measure how well a model identifies off-topic information, where our model yields significantly better performance than the popular pointer-generator summarizer. Human evaluation also confirms that our system summaries are uniformly more informative and faithful as well as less redundant than the seq2seq model.

研究の動機と目的

  • 神経的要約生成モデルにおける意味理解の欠如が、事実誤認や重複を含む要約を生じることに対処する。
  • 入力テキストに含まれるトピック外または悪意ある情報の識別と無視を、ロバストに実行できるモデルを開発する。
  • 意味解析と要約の共同学習により、要約の忠実性、情報量、および重複の低減を実現する。
  • 不要なコンテンツ挿入に対するロバスト性を測定するための新規な悪意的評価スキームを導入する。
  • 実世界のニュースデータを用いた自動指標と人的評価を通じて、モデルの優位性を検証する。

提案手法

  • モデルはまず、人間の要約生成プロセスを模倣して、意味デコーダーを用いて入力記事から顕著な意味的構造(述語と項)を生成する。
  • デコーディング中に、入力記事と生成された意味的構造の両方に注目する二重アテンションメカニズムを採用し、意味的コンテンツと要約生成の整合性を高める。
  • デコーダーでセグメントベースの再ランク付け戦略を採用し、多様で高品質な要約仮説の選択によって、コンテンツカバレッジを促進し、重複を低減する。
  • 意味解析と要約生成の両タスクを最適化する共同学習目的関数に基づいてモデルを訓練する。
  • 入力にトピックに関係のない文を少量挿入することで、モデルのロバスト性をテストする悪意ある評価プロトコルを導入する。
  • 意味解析と要約の両方を統合的に学習できる共有デコーダー・アーキテクチャを採用し、エンドツーエンドの整合性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1入力テキストに悪意あるトピック外挿入が加えられた場合、神経的要約生成モデルはよりロバストに動作できるか?
  • RQ2要約パイプラインに意味解析を統合することで、事実的整合性が向上し、重複が低減するか?
  • RQ3悪意ある条件下で、提案モデルの性能はseq2seqおよびポインタジェネレーターモデルと比較してどのように異なるか?
  • RQ4人的評価において、提案モデルの要約は、既存モデルの要約と比較して、情報量と忠実性の点で顕著に高く評価されるか?
  • RQ5意味的注意デコーダー機構により、抽出的断片が低減され、要約の流れと簡潔さが向上するか?

主な発見

  • 提案モデルは、CNN/Daily Mailベンチマークにおいて、seq2seqおよびポインタジェネレーターモデルと比較して有意に高いROUGEおよびMETEORスコアを達成し、自動要約品質の向上を示した。
  • 悪意ある評価では、トピック外の文が挿入されても、ベースラインモデルが著しく性能を低下させる中、本モデルは高い性能を維持した。
  • 人的評価では、本モデルの要約は、非重複性、流れ、忠実性、情報量の点でseq2seqモデルと比較して顕著に高い順位を得た(p < 0.05)。
  • 本モデルは、seq2seqモデルと比較して著しく少ない、かつ短い抽出的断片を生成し、重複の低減を実現した。
  • 驚くべきことに、情報量と流れの点で、26%のケースにおいて本モデルの出力が人間の基準要約を上回った。これは、簡潔さと明確さに起因するとされた。
  • 二重アテンションメカニズムにゴールドスタンダードの意味的役割を用いることで、ROUGEスコアが約0.5ポイント向上し、意味解析の質の向上が価値を持つことを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。