Skip to main content
QUICK REVIEW

[论文解读] On the Evaluation Metrics for Paraphrase Generation

Lingfeng Shen, Lemao Liu|arXiv (Cornell University)|Feb 17, 2022
Advanced Text Analysis Techniques被引用 4
一句话总结

本文提出 ParaScore,一种用于释义生成的新评估指标,通过结合基于参考文本和无参考文本的组件,显式建模语义相似性和词汇差异性。通过大量实验,ParaScore 在与人类判断的一致性方面显著优于现有指标,尤其解决了以往被忽视的词汇差异性在释义质量中的重要性问题。

ABSTRACT

In this paper we revisit automatic metrics for paraphrase evaluation and obtain two findings that disobey conventional wisdom: (1) Reference-free metrics achieve better performance than their reference-based counterparts. (2) Most commonly used metrics do not align well with human annotation. Underlying reasons behind the above findings are explored through additional experiments and in-depth analyses. Based on the experiments and analyses, we propose ParaScore, a new evaluation metric for paraphrase generation. It possesses the merits of reference-based and reference-free metrics and explicitly models lexical divergence. Experimental results demonstrate that ParaScore significantly outperforms existing metrics.

研究动机与目标

  • 重新评估现有自动评估指标在释义生成任务中与人类标注的一致性。
  • 探究为何无参考文本指标在释义评估中有时会优于基于参考文本的指标。
  • 识别当前评估指标的局限性,尤其是其在词汇差异性方面与人类判断对齐不佳的问题。
  • 提出一种新评估框架 ParaScore,整合基于参考文本和无参考文本指标的优势。
  • 倡导开发更能自然反映词汇差异性在释义质量中重要性的新基准。

提出的方法

  • 作者在两个多语言基准(Twitter-Para,英文;BQ-Para,中文)上收集并评估了10种广泛使用的指标——包括基于参考文本和无参考文本的指标。
  • 他们引入一种解耦框架,利用归因分析方法,分离并测量语义相似性和词汇差异性对指标得分的贡献。
  • ParaScore 设计为一种混合指标,结合基于参考文本和无参考文本的组件,并通过分段函数专门建模词汇差异性(DS)模块。
  • 该指标采用基于 BERT 的句子嵌入来捕捉语义相似性,并利用自注意力机制从输入到候选句中捕获词汇差异性。
  • 超参数在10%的开发集上进行调优,性能在每个基准剩余的90%数据上进行评估。
  • 通过与人类标注的相关性分析,验证了 ParaScore 的有效性,结果显著优于现有指标。

实验结果

研究问题

  • RQ1为何无参考文本指标在释义评估中表现优于基于参考文本的指标,这与自然语言处理评估中的传统认知相悖?
  • RQ2现有指标在多大程度上与人类判断一致,特别是在捕捉词汇差异性方面?
  • RQ3导致 BLEU 和 ROUGE 等广泛使用指标在释义评估中表现不佳的根本原因是什么?
  • RQ4如何设计一种新指标,以有效建模释义生成中的语义相似性和词汇差异性?
  • RQ5词汇差异性在人类评估中扮演什么角色,如何在自动指标中更好地捕捉它?

主要发现

  • 无参考文本指标在英文和中文基准上均优于基于参考文本的指标,这与自然语言处理评估中的传统预期相悖。
  • 大多数常用指标,包括 BLEU 和 ROUGE,在衡量词汇差异性方面与人类标注的相关性较弱。
  • 现有指标如 BERTScore.Free 虽表现竞争力,但仍未能充分建模词汇差异性,表明当前评估实践存在根本性局限。
  • ParaScore 在两个基准上均显著优于所有基线指标,与人类判断的相关性更高,证明其与人类评估的对齐性更优。
  • 消融实验确认,词汇差异性得分(DS)及其分段函数是 ParaScore 的关键组成部分,移除后性能显著下降。
  • 分析表明,输入-候选句与参考-候选句之间距离的分布,显著影响无参考文本与基于参考文本指标的相对性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。