Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Sentence Compression using Denoising Auto-Encoders

Thibault Févry, Jason Phang|arXiv (Cornell University)|Sep 7, 2018
Natural Language Processing Techniques被引用数 4
ひとこと要約

この論文では、文の並べ替えとノイズを加えることで文を汚染し、元の文を再構築することによって学習する、完全に教師なしの文要約手法を提案している。元の文と要約文のペairデータにさらさら触れることなく、文法的に正しい意味を保った要約を生成するが、ROUGEスコアでは劣るものの、人間評価では教師ありモデルと同等の性能を示す。

ABSTRACT

In sentence compression, the task of shortening sentences while retaining the original meaning, models tend to be trained on large corpora containing pairs of verbose and compressed sentences. To remove the need for paired corpora, we emulate a summarization task and add noise to extend sentences and train a denoising auto-encoder to recover the original, constructing an end-to-end training regime without the need for any examples of compressed sentences. We conduct a human evaluation of our model on a standard text summarization dataset and show that it performs comparably to a supervised baseline based on grammatical correctness and retention of meaning. Despite being exposed to no target data, our unsupervised models learn to generate imperfect but reasonably readable sentence summaries. Although we underperform supervised models based on ROUGE scores, our models are competitive with a supervised baseline based on human evaluation for grammatical correctness and retention of meaning.

研究の動機と目的

  • 元の文と要約文のペアデータを一切必要としない文要約モデルの開発を目的とする。
  • 文書の単一言語コーパス上で教師なし事前学習を行うことで、ノイズ除去オートエナコーダーが文の要約を学習できるかを検証すること。
  • 目標要約文にアクセスできない状況下で、文法的正しさと意味の保持の両面でのモデル性能を評価すること。
  • 文の埋め込み表現がモデル出力品質およびROUGEスコアに与える影響を調査すること。
  • ROUGEスコアが要約品質の指標としてどれほど妥当かを人間評価と比較することで、ROUGEの限界を評価すること。

提案手法

  • モデルは、単一の単一言語コーパスからの文を汚染したバージョンで学習するノイズ除去オートエナコーダー構造を採用している。
  • 入力文は、語の並べ替えとランダムトークンノイズを加えることで「ノイズ混じり」の入力にされる。
  • モデルは汚染された入力を元に元の文を再構築することを学習し、ノイズ除去の過程で暗黙的に要約の仕組みを学習する。
  • 出力長を指定することで、異なる圧縮度の要約を生成できるようにモデルを条件づけている。
  • 文の埋め込み(例:InferSent)を用いてモデルを条件づけているが、人間評価では妥協が生じる。
  • 学習はエンドツーエンドかつ完全に教師なしであり、ペアデータを一切使用せず、単一の単一言語コーパスに依存している。

実験結果

リサーチクエスチョン

  • RQ1ペア学習例が一切ない状況下でも、ノイズ除去オートエナコーダーが効果的な文要約を学習できるか?
  • RQ2人間評価において、文法的正しさと意味保持の観点から、教師なしモデルと教師ありベースラインの性能を比較するとどうなるか?
  • RQ3文の埋め込み表現をモデルに条件づけると、出力要約の品質は向上するか、悪化するか?
  • RQ4ROUGEスコアは、文要約の要約品質に関する人間の判断とどの程度相関しているか?
  • RQ5汚染された文をノイズ除去することで、意味的で文法的に正しい要約を生成できるか?

主な発見

  • 教師なしノイズ除去オートエナコーダーは、文法的に正しい意味を保持した要約文を生成し、人間評価では教師ありベースラインと同等の性能を示した。
  • ROUGEスコアでは劣るが、特にF1スコアで劣るものの、文の埋め込みを用いた場合、人間評価では教師ありモデルの出力よりも正確で自然な要約と判断された。
  • InferSentの文の埋め込みを組み込むことでROUGEスコアは向上したが、文法的正しさと意味保持の両面で人間評価スコアが著しく低下した。
  • 出力長を指定することで、異なる圧縮度の要約を生成でき、圧縮度の制御が可能になった。
  • 並べ替えられたりノイズが加えられた入力から構造を回復することで、モデルは文の要約を暗黙的に学習していることが示唆された。
  • ROUGEスコアは人間評価の良い指標ではなく、理解可能性や意味的整合性と相関しないことが多く、不適切であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。