Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Reference-Free Summary Quality Evaluation via Contrastive Learning

Hanlu Wu, Tengfei Ma|arXiv (Cornell University)|Oct 5, 2020
Topic Modeling参考文献 28被引用数 4
ひとこと要約

本稿では、人間のリファレンスを必要とせず、対照的学習を用いて要約の言語的および意味的品質を評価するリファレンスフリーで教師なしの要約品質評価手法を提案する。タスク固有のネガティブサンプルを構築し、順序付け損失を用いてBERTベースの評価者を訓練することで、NewsroomおよびCNN/Daily Mailの両データセットで人間の判断と高い相関を達成し、異なるデータセット間での一般化性能が優れていることが示された。

ABSTRACT

Evaluation of a document summarization system has been a critical factor to impact the success of the summarization task. Previous approaches, such as ROUGE, mainly consider the informativeness of the assessed summary and require human-generated references for each test summary. In this work, we propose to evaluate the summary qualities without reference summaries by unsupervised contrastive learning. Specifically, we design a new metric which covers both linguistic qualities and semantic informativeness based on BERT. To learn the metric, for each summary, we construct different types of negative samples with respect to different aspects of the summary qualities, and train our model with a ranking loss. Experiments on Newsroom and CNN/Daily Mail demonstrate that our new evaluation method outperforms other metrics even without reference summaries. Furthermore, we show that our method is general and transferable across datasets.

研究の動機と目的

  • 人間がアノテートしたリファレンスに依存しない自動的でリファレンスフリーな要約評価指標の開発を目的とする。
  • 文法的正確性や文の流れといった言語的品質(例:自然さ、文法的正しさ)と、関連性や重複度といった意味的情報量(例:関連性、重複度)を統合的にモデル化することで、評価の精度を向上させることを目的とする。
  • 人間によるスコア評価やリファレンス要約が一切不要な教師なし学習を可能にするために、対照的学習を用いた要約評価者を訓練することを目的とする。
  • 再訓練なしに異なる要約データセット間で一般化できるようにすることを目的とする。

提案手法

  • 言語的および意味的品質の両方を考慮したBERTベースの評価者を設計し、要約のスコアを付与する。
  • 語の置換、文のシャッフル、文の削除などの方法で、言語的および意味的次元に沿って複数の種類のネガティブサンプルを構築する。
  • オリジナル要約とネガティブサンプル間のスコア差を最大化するように、順序付け損失を用いた対照的学習フレームワークで評価者を訓練する。
  • リファレンス要約への依存を排除するために、文書レベルのBERT埋め込みを意味的監視のソースとして用いる。
  • 対照的損失を最適化することで、高品質な要約がポジティブなアンカーに近づき、任意のネガティブサンプルよりも遠ざかるようにモデルをエンドツーエンドで最適化する。
  • あるデータセットで学習し、別のデータセットでテストするなど、微調整なしに異なるデータセット間での転送を可能にする。

実験結果

リサーチクエスチョン

  • RQ1リファレンスフリーで教師なしの手法が、要約評価において人間の判断と高い相関を達成できるか?
  • RQ2人間がアノテートしたスコアやリファレンス要約が一切ない状況でも、対照的学習が要約評価者を効果的に訓練できるか?
  • RQ3言語的品質と意味的情報量を同時にモデル化することで、単一に意味的類似度に焦点を当てた手法よりも評価性能が向上するか?
  • RQ4再訓練なしに、異なる要約データセット間で一般化できるか?

主な発見

  • 提案手法であるLS_Scoreは、Newsroom(全体で0.6563)およびCNN/Daily Mail(全体で0.3342)の両データセットで、人間の判断とのスピアマン相関が最高を記録し、ROUGE、BERTScore-R、MoverScore、BERT+Cos+Docを上回った。
  • Newsroomでは、情報量(informativeness)で0.7163、全体の品質で0.6563の相関を達成し、BERTScore-R(0.2972および0.2787)を顕著に上回った。
  • CNN/Daily Mailでは、自然さ(fluency)で0.5933、重複度(redundancy)で0.2875の相関を達成し、BERT+Linear(0.4511および0.1664)およびBERTScore-R(0.2227および0.2780)を上回った。
  • アブレーションスタディの結果、同じ対照的学習設定を用いても、標準的なBERT+Linearベースラインに比べ、提案された評価者を用いた対照的学習フレームワークが優れていることが確認された。
  • クロスデータセット転送実験では、LS_Score_crossが強力な性能(例:Newsroomで0.6271、CNN/Daily Mailで0.2874)を維持しており、本手法の一般化能力が裏付けられた。
  • CNN/Daily Mailで学習したモデルがNewsroomに適応し、逆にNewsroomで学習したモデルがCNN/Daily Mailに適応するなど、異なるデータセット間で強力な転送性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。