Skip to main content
QUICK REVIEW

[论文解读] SMART: Sentences as Basic Units for Text Evaluation

Reinald Kim Amplayo, Peter J. Liu|arXiv (Cornell University)|Aug 1, 2022
Topic Modeling被引用 5
一句话总结

SMART 是一种新颖的文本评估指标,将句子视为基本单位而非词符,使用软匹配函数(基于字符串或基于模型)来比较候选句、参考句和源文档句子。在 SummEval 基准测试中,SMART 在所有四个摘要质量维度(连贯性、事实性、流畅性、信息量)上均实现了与人类判断的最先进相关性,优于 ROUGE 和 BARTScore,尤其在长摘要上表现更优,并且模型偏差更低。

ABSTRACT

Widely used evaluation metrics for text generation either do not work well with longer texts or fail to evaluate all aspects of text quality. In this paper, we introduce a new metric called SMART to mitigate such limitations. Specifically, We treat sentences as basic units of matching instead of tokens, and use a sentence matching function to soft-match candidate and reference sentences. Candidate sentences are also compared to sentences in the source documents to allow grounding (e.g., factuality) evaluation. Our results show that system-level correlations of our proposed metric with a model-based matching function outperforms all competing metrics on the SummEval summarization meta-evaluation dataset, while the same metric with a string-based matching function is competitive with current model-based metrics. The latter does not use any neural model, which is useful during model development phases where resources can be limited and fast evaluation is required. Finally, we also conducted extensive analyses showing that our proposed metrics work well with longer summaries and are less biased towards specific models.

研究动机与目标

  • 为解决现有文本评估指标的局限性,例如在长文本上表现不佳以及缺乏对源文档的依赖。
  • 减少对特定模型的偏差,尤其是对 BARTScore 等基于模型的指标,这些指标倾向于偏好在相同架构上微调过的模型。
  • 在模型开发过程中提供一种快速、轻量级的神经网络模型基评估指标替代方案,同时不牺牲与人类判断的相关性。
  • 实现对长篇和多句文本输出的稳健评估,包括在摘要生成和长篇问答中的应用。
  • 通过集成多语言模型(如 multilingual BERT 和 CHRF)支持多语言评估。

提出的方法

  • SMART 将句子视为匹配的基本单元,取代 ROUGE 和 BLEU 中使用的词符级匹配。
  • 它采用一种软匹配函数,为句子对返回 0 到 1 之间的得分,即使无精确匹配也能实现语义相似性比较。
  • 该指标支持两种变体:SMART-[1|2|L]-BLEURT(基于模型,使用 BERT 嵌入)和 SMART-[1|2|L]-CHRF(基于字符串,使用字符 n-gram F 值)。
  • 将源文档句子纳入评估,以实现对事实性和文本依据性的评估,从而提升事实性评估的准确性。
  • 该指标使用句子级 n-gram 重叠和最长公共子序列(LCS)来计算匹配得分,增强了对句子重排的鲁棒性。
  • 提供一个工具包,以支持快速部署,并可未来扩展支持新的匹配函数或多源输入。

实验结果

研究问题

  • RQ1与词符级匹配相比,句子级软匹配是否能提升文本生成的自动评估性能?
  • RQ2在评估中引入源文档句子是否能增强事实性和依据性评估?
  • RQ3SMART 在长摘要上的表现如何,与 ROUGE 和 BARTScore 相比,特别是在系统级与人类判断的相关性方面?
  • RQ4当使用神经匹配函数时,SMART 对特定模型的偏差程度如何?
  • RQ5基于字符串的非神经网络变体 SMART 是否能实现与基于模型的指标相当的性能,同时在模型开发过程中实现快速评估?

主要发现

  • 使用 BLEURT 软匹配函数的 SMART 在 SummEval 数据集上,于所有四个质量维度(连贯性、事实性、流畅性、信息量)上均实现了与人类判断最高的系统级 Kendall tau 相关系数。
  • 基于字符串的变体 SMART-[1|2|L]-CHRF 实现了与人类判断具有竞争力的相关性,因此适用于模型开发过程中的快速评估。
  • 随着摘要长度的增加,SMART 在系统级相关性方面优于 ROUGE 和 BARTScore,显示出对长文本更强的可扩展性。
  • SMART-[1|2|L]-BLEURT 在与人类判断的排名差异标准差最小,且配对排名准确率最高,表明其是所有评估指标中偏差最小的。
  • 该指标对抽取式模型和 BART 模型本身表现出较低的偏差,而 BARTScore 则显著高估了 BART 模型的性能。
  • SMART 在多语言评估中表现有效,因为 BLEURT 和 CHRF 均设计用于支持形态丰富的多语言文本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。