Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Automatic Evaluation in Sentence Simplification

Thomas Scialom, Louis Martin|arXiv (Cornell University)|Apr 15, 2021
Text Readability and Simplification参考文献 14被引用数 13
ひとこと要約

本稿では、文の簡略化におけるQuestEvalのBERTScore強化版を提案し、システム生成の簡略化文に対してBERTScoreとQuestEvalが人間の評価と高い相関を示すが、これは主に次元間の依存性に起因する偽の相関であることを示している。人間が書いた簡略化文では、意味保持性と有意に相関するものはQuestEvalのみである。これは、大多数のメトリクスが単に簡略化度や意味保持性を信頼性高く評価できていないことを示している。

ABSTRACT

Automatic evaluation remains an open research question in Natural Language Generation. In the context of Sentence Simplification, this is particularly challenging: the task requires by nature to replace complex words with simpler ones that shares the same meaning. This limits the effectiveness of n-gram based metrics like BLEU. Going hand in hand with the recent advances in NLG, new metrics have been proposed, such as BERTScore for Machine Translation. In summarization, the QuestEval metric proposes to automatically compare two texts by questioning them. In this paper, we first propose a simple modification of QuestEval allowing it to tackle Sentence Simplification. We then extensively evaluate the correlations w.r.t. human judgement for several metrics including the recent BERTScore and QuestEval, and show that the latter obtain state-of-the-art correlations, outperforming standard metrics like BLEU and SARI. More importantly, we also show that a large part of the correlations are actually spurious for all the metrics. To investigate this phenomenon further, we release a new corpus of evaluated simplifications, this time not generated by systems but instead, written by humans. This allows us to remove the spurious correlations and draw very different conclusions from the original ones, resulting in a better understanding of these metrics. In particular, we raise concerns about very low correlations for most of traditional metrics. Our results show that the only significant measure of the Meaning Preservation is our adaptation of QuestEval.

研究の動機と目的

  • BLEU や SARI といった伝統的な自動評価メトリクスが文の簡略化において人間の評価と低相関を示すという限界を是正すること。
  • 最近開発されたメトリクス(BERTScore や QuestEval)が、構文的・語彙的簡略化を意図していないにもかかわらず、システム生成の簡略化文に対して高い相関を示す理由を解明すること。
  • 評価次元間の相互依存性(流暢さ、簡略化度、意味保持性)に起因する偽の相関を特定し、是正すること。
  • 人間によるアノテーションが施された簡略化文の新しいコーパス(Human-Likert)を公開し、人間水準の出力に対するメトリクスの信頼性の高い評価を可能にすること。
  • システム生成出力と人間が書いた出力の両方に対してメトリクスの性能を比較することで、自動評価メトリクスの妥当性を再評価し、現在の評価手法における根本的な欠陥を明らかにすること。

提案手法

  • 元のQuestEvalメトリクスを改変し、正確一致類似度の代わりにBERTScoreを採用することで、意味的類似度(同義語の扱いを含む)を可能にする。
  • BERT埋め込みを用いて、参照文と仮説文のトークンレベル類似度を計算し、言い換えや語彙的変化に対して耐性を持つようにする。
  • 流暢さ、簡略化度、意味保持性のスコアを備えた、1,000件の人工アノテーション済み簡略化文(Human-Likert)の新しいコーパスを収集する。
  • システム生成(System-Likert)および人間が書いた(Human-Likert)簡略化文の両方に対して、自動メトリクスと人間評価のピアソン相関係数を計算する。
  • 部分相関分析を実施し、評価次元間の相互依存性に起因する偽の相関を解体する。
  • BLEU、SARI、FKGL、BERTScore、および改変済みQuestEvalの性能を両コーパスで比較し、真の意味的・簡略化品質を反映するメトリクスを特定する。

実験結果

リサーチクエスチョン

  • RQ1BERTScore や QuestEval が、構文的・語彙的簡略化を意図していないにもかかわらず、システム生成の簡略化文に対して人間評価と高い相関を示すのはなぜか?
  • RQ2流暢さ、簡略化度、意味保持性の間の相互依存性に起因する、自動メトリクスと人間評価の間の観察された相関がどの程度偽物であるか?
  • RQ3人間が書いた簡略化文(より流暢で人間水準に近い)に対して、自動メトリクスの相関はどのように変化するか?
  • RQ4ゴールリファレンスが存在しない状況、特に高品質な出力に対して、どのメトリクスが意味保持性と簡略化度を信頼性高く測定できるか?
  • RQ5改変済みQuestEvalメトリクスは、参照文なしの代替手段として、文の簡略化システムの評価に耐性を持って使えるだろうか?

主な発見

  • システム生成の簡略化文では、BERTScore と QuestEval が人間評価と最も高い相関を示し、BERTScore は流暢さと簡略化度(r ≈ 40)でリーダーを走り、QuestEval は意味保持性で優れた性能を示す。
  • 人間が書いた簡略化文では、唯一FKGLが簡略化度と有意に相関(r = 34.7)を示し、唯一QuestEvalが意味保持性と有意に相関(r = 34.7)を示すが、BERTScore は有意な相関を示さない。
  • システム生成データで観察された高い相関は、主に流暢さ・簡略化度・意味保持性の次元間の強い相関に起因する偽の相関である。
  • 人間が書いたデータにおいてQuestEvalと簡略化度の逆相関は、メトリクスが単に簡略化されたテキストにバイアスをもたないことを示しており、事実の内容に焦点を当てていることを確認している。
  • 伝統的なメトリクス(BLEU や SARI)は、人間が書いた簡略化文において、いかなる次元に対しても有意な相関を示さない。これは、高品質な出力を評価できないことを示している。
  • 本研究は、現在の自動評価手法が相関の混同に起因する根本的な欠陥を抱えていることを明らかにし、人間アノテーション済みの高品質データを用いたメトリクスの再評価を要請している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。