Skip to main content
QUICK REVIEW

[论文解读] Rethinking Automatic Evaluation in Sentence Simplification

Thomas Scialom, Louis Martin|arXiv (Cornell University)|Apr 15, 2021
Text Readability and Simplification参考文献 14被引用 13
一句话总结

本文提出了一种基于 BERTScore 的 QuestEval 改进方法,用于句子简化任务。结果表明,尽管 BERTScore 和 QuestEval 在系统生成的简化句上与人类判断具有高度相关性,但这种相关性在很大程度上是虚假的,源于流畅性、简洁性和语义保留性之间的维度间依赖。在人工编写的简化句上,只有 QuestEval 与语义保留性显著相关,揭示了大多数指标无法可靠地独立评估简洁性和语义保留性。

ABSTRACT

Automatic evaluation remains an open research question in Natural Language Generation. In the context of Sentence Simplification, this is particularly challenging: the task requires by nature to replace complex words with simpler ones that shares the same meaning. This limits the effectiveness of n-gram based metrics like BLEU. Going hand in hand with the recent advances in NLG, new metrics have been proposed, such as BERTScore for Machine Translation. In summarization, the QuestEval metric proposes to automatically compare two texts by questioning them. In this paper, we first propose a simple modification of QuestEval allowing it to tackle Sentence Simplification. We then extensively evaluate the correlations w.r.t. human judgement for several metrics including the recent BERTScore and QuestEval, and show that the latter obtain state-of-the-art correlations, outperforming standard metrics like BLEU and SARI. More importantly, we also show that a large part of the correlations are actually spurious for all the metrics. To investigate this phenomenon further, we release a new corpus of evaluated simplifications, this time not generated by systems but instead, written by humans. This allows us to remove the spurious correlations and draw very different conclusions from the original ones, resulting in a better understanding of these metrics. In particular, we raise concerns about very low correlations for most of traditional metrics. Our results show that the only significant measure of the Meaning Preservation is our adaptation of QuestEval.

研究动机与目标

  • 为解决传统自动评估指标(如 BLEU 和 SARI)在句子简化任务中与人类判断相关性较低的问题。
  • 探究为何近期指标(如 BERTScore 和 QuestEval)在系统生成的简化句上能取得与人类判断的高相关性,尽管这些指标并非专为衡量句法或词汇简洁性而设计。
  • 识别并缓解评估指标中因流畅性、简洁性和语义保留性之间相互依赖而产生的虚假相关性。
  • 发布一个新的由人工标注的简化句语料库(Human-Likert),以支持对人类水平输出的更可靠指标评估。
  • 通过对比系统生成与人工编写的简化句上指标的表现,重新评估自动指标的有效性,揭示当前评估实践中的根本性缺陷。

提出的方法

  • 通过将原始 QuestEval 指标中的精确匹配相似度替换为 BERTScore,以支持语义相似度计算,包括同义词处理。
  • 使用 BERT 嵌入计算参考句与假设句之间的词元级相似度,提升对重述和词汇变化的鲁棒性。
  • 收集一个新的由人工标注的语料库(Human-Likert),包含 1,000 个由人工编写的简化句,附带流畅性、简洁性和语义保留性的评分。
  • 在系统生成的简化句(System-Likert)和人工编写的简化句(Human-Likert)上,计算自动指标与人类判断之间的皮尔逊相关系数。
  • 进行偏相关分析,以分离由评估维度间相互依赖所驱动的虚假相关性。
  • 在两个语料库上对比 BLEU、SARI、FKGL、BERTScore 和改进后的 QuestEval 的表现,以识别真正反映语义质量和简洁性质量的指标。

实验结果

研究问题

  • RQ1为何 BERTScore 和 QuestEval 在系统生成的简化句上与人类判断具有高相关性,尽管它们并非专为衡量句法或词汇简洁性而设计?
  • RQ2评估指标与人类判断之间的观察到的相关性在多大程度上是由于流畅性、简洁性和语义保留性之间的相互依赖而产生的虚假相关性?
  • RQ3当在更流畅、更接近人类水平质量的人工编写简化句上进行评估时,自动指标的相关性如何变化?
  • RQ4在缺乏标准参考句的情况下,哪些指标能够可靠地衡量语义保留性和简洁性,特别是在高质量输出上?
  • RQ5改进后的 QuestEval 指标能否作为评估句子简化系统的一种稳健的、无需参考句的替代方案?

主要发现

  • 在系统生成的简化句上,BERTScore 和 QuestEval 与人类判断的相关性最高,其中 BERTScore 在流畅性和简洁性方面表现最佳(r ≈ 40),而 QuestEval 在语义保留性方面表现更优。
  • 在人工编写的简化句上,只有 FKGL 与简洁性显著相关(r = 34.7),只有 QuestEval 与语义保留性显著相关(r = 34.7),而 BERTScore 无显著相关性。
  • 在系统生成数据上观察到的高相关性在很大程度上是虚假的,主要由流畅性、简洁性和语义保留性维度之间的强相互关联驱动。
  • QuestEval 与简洁性在人工编写数据上的负相关性表明,该指标并不偏向于更简单的文本,从而证实其关注点在于事实内容。
  • 传统指标如 BLEU 和 SARI 在人工编写的简化句上与任何维度均无显著相关性,表明其在评估高质量输出时完全失效。
  • 本研究揭示,当前自动评估实践因存在混淆性相关性而存在根本性缺陷,并呼吁使用人工标注的高质量数据对评估指标进行重新审视。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。