Skip to main content
QUICK REVIEW

[論文レビュー] Better Summarization Evaluation with Word Embeddings for ROUGE

Jun-Ping Ng, Viktoria Abrecht|arXiv (Cornell University)|Aug 25, 2015
Topic Modeling参考文献 13被引用数 12
ひとこと要約

本稿では、事前学習済み単語埋め込みを用いて語彙的重複を意味的類似度に置き換えることで、要約の評価を向上させたROUGEの拡張版、ROUGE-WEを提案する。表面的な語の一致ではなく意味的類似度を測定することで、ROUGE-WEは人間の判断との相関が著しく向上し、TAC AESOP 評価において、C_S_IIITH3 などの最先端システムを上回るスピアマン順位相関およびケンドール順位相関を達成した。

ABSTRACT

ROUGE is a widely adopted, automatic evaluation measure for text summarization. While it has been shown to correlate well with human judgements, it is biased towards surface lexical similarities. This makes it unsuitable for the evaluation of abstractive summarization, or summaries with substantial paraphrasing. We study the effectiveness of word embeddings to overcome this disadvantage of ROUGE. Specifically, instead of measuring lexical overlaps, word embeddings are used to compute the semantic similarity of the words used in summaries instead. Our experimental results show that our proposal is able to achieve better correlations with human judgements when measured with the Spearman and Kendall rank coefficients.

研究の動機と目的

  • 要約の言い換えを伴う抽象的要約の評価において、語彙的類似度に偏るROUGEの欠点を是正すること。
  • 表面的なn-gram重複に依存するのではなく、単語埋め込みを用いて意味的類似度を組み込むことで、自動要約評価を改善すること。
  • 語彙的に異なるが意味的に同等の要約について、ROUGEの人的判断との相関を高めること。
  • 正確な語の一致に依存するのを減らすことで、ROUGEの抽象的要約への適用可能性を拡大すること。
  • 意味的類似度を単語埋め込みを用いて測定することで、従来のROUGEバージョンよりもより強固で人的判断と整合性の高い評価指標が得られることを示すこと。

提案手法

  • 単語を意味的類似度がベクトルの距離に相関する密次元空間にマップするため、word2vec埋め込みを採用する。
  • ROUGEの語彙的重複計算を、unigram、bigram、skip-bigramの単語埋め込み間の意味的類似度に置き換える。
  • 語彙的意味をフレーズレベルの比較で保持するため、unigram単語埋め込みの要素ごとの積を用いてbigram表現を構成する。
  • 強化された意味的類似度をROUGEの変種に統合する:ROUGE-WE-1、ROUGE-WE-2、ROUGE-WE-SU4。
  • システムスコアと人的判断との整合性を評価するために、非パラメトリック順位相関(スピアマンおよびケンドール)を用いる。
  • TAC AESOP 2011 データセット上で評価を行い、ベースラインROUGEおよび最高性能を示したAESOPシステムと比較する。

実験結果

リサーチクエスチョン

  • RQ1語彙的重複を超える意味的類似度を捉えることで、単語埋め込みがROUGEの人間の判断との相関を向上させられるか?
  • RQ2C_S_IIITH3 や BE-HM などの最先端システムと比較して、ROUGE-WEは人的アノテーションとの順位相関においてどのように性能を発揮するか?
  • RQ3単語埋め込みの使用が、顕著な言い換えを伴う抽象的要約の評価におけるROUGEの適性を高められるか?
  • RQ4ROUGE-WE-2 と ROUGE-WE-SU4 は、特にスイップビグラン(SU4)設定において、なぜ異なる性能パターンを示すのか?
  • RQ5単語埋め込みの乗算による意味的合成が、要約評価におけるフレーズレベルの意味を効果的に表現できるか?

主な発見

  • ROUGE-WE-1 は人的ピラミッドスコアとのスピアマン相関係数が 0.9138 を達成し、最高性能を示したAESOPシステム C_S_IIITH3(0.9033)を上回った。
  • ROUGE-WE-1 はケンドールtau係数 0.7534 を達成し、ケンドール係数において C_S_IIITH3(0.7582)をわずかに上回り、人的判断と強い整合性を示した。
  • ROUGE-WE-2 は、すべての相関指標においてROUGE-2を一貫して上回り、連続的bigram評価における意味的類似度の利点を実証した。
  • ROUGE-WE-SU4 はピラミッド評価および応答性評価において ROUGE-SU4 よりも性能が低く、非連続的スイップビグランにおける意味的意味の合成に課題があると考えられる。
  • 単語埋め込みの乗算による意味的合成は、連続的bigram(ROUGE-WE-2)では効果的であるが、スイップビグラン(ROUGE-WE-SU4)では不十分であることが示され、現在の合成モデルの限界を示唆している。
  • ROUGE-WE-1 はベースラインROUGEおよび他の優れたシステムと比較して優れた性能を示し、要約評価における意味的類似度の有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。