Skip to main content
QUICK REVIEW

[论文解读] Automatic Text Evaluation through the Lens of Wasserstein Barycenters

Paolo Colombo, Guillaume Staerman|arXiv (Cornell University)|Aug 27, 2021
Topic Modeling被引用 11
一句话总结

本文提出 BaryScore,一种基于 BERT 的新型自动文本评估指标,利用 Wasserstein 中心(Wasserstein barycenters)聚合 Transformer 各层的深度上下文嵌入,避免了传统聚合方法带来的几何失真。BaryScore 在四项 NLG 任务——机器翻译、摘要生成、图像字幕和数据到文本生成中达到最先进性能,展现出更优的一致性和鲁棒性,尤其在抽象摘要生成任务中表现突出,而此前基于 BERT 的指标在系统层面表现失败。

ABSTRACT

A new metric exttt{BaryScore} to evaluate text generation based on deep contextualized embeddings e.g., BERT, Roberta, ELMo) is introduced. This metric is motivated by a new framework relying on optimal transport tools, i.e., Wasserstein distance and barycenter. By modelling the layer output of deep contextualized embeddings as a probability distribution rather than by a vector embedding; this framework provides a natural way to aggregate the different outputs through the Wasserstein space topology. In addition, it provides theoretical grounds to our metric and offers an alternative to available solutions e.g., MoverScore and BertScore). Numerical evaluation is performed on four different tasks: machine translation, summarization, data2text generation and image captioning. Our results show that exttt{BaryScore} outperforms other BERT based metrics and exhibits more consistent behaviour in particular for text summarization.

研究动机与目标

  • 解决现有指标(如 MoverScore 和 BertScore)中使用基于欧几里得的方法(如幂平均)聚合多层 BERT 嵌入时引入的几何不一致性问题。
  • 提出一种理论基础坚实、无需超参数调优的方法,利用最优传输原理将 Transformer 各层的上下文嵌入进行组合。
  • 通过利用 Wasserstein 空间中的拓扑特性,提升自然语言生成任务中自动文本评估的可靠性,实现更可靠的语义相似性度量。
  • 证明 Wasserstein 中心在 BERT 基准指标中,相较于层选择或幂平均聚合,提供了更鲁棒、更一致的聚合框架。
  • 在包括摘要生成、机器翻译、图像字幕和数据到文本生成在内的多样化 NLG 任务中,验证所提出指标的有效性。

提出的方法

  • 将每个 Transformer 层的输出建模为 Wasserstein 空间中的概率分布,从而可应用最优传输理论进行语义比较。
  • 通过计算各层嵌入的 Wasserstein 中心来聚合跨层信息,保留嵌入空间的几何结构。
  • 使用 Wasserstein 距离作为基础度量来计算中点,确保聚合过程与嵌入空间的底层度量保持一致。
  • 通过消除对单一层的选择(如 BertScore)或对幂平均指数的选择(如 MoverScore),避免超参数调优。
  • 最终 BaryScore 通过计算参考文本与候选文本的中点之间的 Wasserstein 距离得到,使用 BERT、RoBERTa 或 ELMo 的上下文嵌入。
  • 该方法在多个 NLG 任务中统一应用,评估结果与人工判断及标准基线进行对比。

实验结果

研究问题

  • RQ1Wasserstein 中心能否为文本生成评估中多层上下文嵌入的聚合提供更一致且理论基础更坚实的方案?
  • RQ2所提出的 BaryScore 指标是否在多样化的 NLG 任务中,相较于 BertScore 和 MoverScore 等现有 BERT 基准指标,与人工判断的相关性更高?
  • RQ3在以往指标表现出不一致的场景中(如抽取式摘要生成系统),BaryScore 表现如何?
  • RQ4基于中点的聚合方法能否缓解基于最优传输指标中因欧几里得聚合导致的几何失真?
  • RQ5BaryScore 在不同文本生成任务中是否具有鲁棒性,包括摘要生成和数据到文本生成等存在高词汇差异的任务?

主要发现

  • 在 XSum 摘要数据集上,BaryScore 与人工判断的相关性最高,优于 BertScore 和 MoverScore,尤其在系统层面表现突出,而此前指标在此类场景中失效。
  • 在 WebNLG2020 数据到文本任务中,BaryScore 在 9 种配置中的 6 种中取得最佳结果,展现出优异的性能与一致性。
  • 在 MSCOCO 图像字幕数据集上的图像字幕任务中,BaryScore 超过所有基于 BERT 的指标,仅在 LEIC(使用多模态信息)之外,证实其在视觉-语言任务中的有效性。
  • BaryScore 在文本级和系统级评估中均保持高度一致性,而 BertScore 和 MoverScore 在抽取式摘要生成任务中系统层面表现显著下降。
  • 在 WebNLG 任务中,BaryScore 与人工判断在正确性方面的皮尔逊相关系数达到 0.917,斯皮尔曼等级相关系数 ρ = 0.900,肯德尔等级相关系数 τ = 0.783,表明与人工评估高度一致。
  • BaryScore +(一种增加归一化处理的变体)在所有任务中均取得具有竞争力的结果,展现出良好的鲁棒性与泛化潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。