Skip to main content
QUICK REVIEW

[论文解读] How not to Lie with a Benchmark: Rearranging NLP Leaderboards

Tatiana Shavrina, Valentin Malykh|arXiv (Cornell University)|Dec 2, 2021
Explainable Artificial Intelligence (XAI)被引用 4
一句话总结

本文挑战了在自然语言处理(NLP)基准测试中使用算术平均值聚合得分的做法,提出几何平均值和调和平均值更适合用于平均归一化性能指标。该研究对 GLUE、SuperGLUE、XGLUE 和 XTREME 基准测试中的模型进行了重新排序,发现人类表现依然领先,当前最先进(SOTA)模型落后约 1.5–2%,揭示了标准排行榜排名因平均方法存在缺陷而产生的偏差。

ABSTRACT

Comparison with a human is an essential requirement for a benchmark for it to be a reliable measurement of model capabilities. Nevertheless, the methods for model comparison could have a fundamental flaw - the arithmetic mean of separate metrics is used for all tasks of different complexity, different size of test and training sets. In this paper, we examine popular NLP benchmarks' overall scoring methods and rearrange the models by geometric and harmonic mean (appropriate for averaging rates) according to their reported results. We analyze several popular benchmarks including GLUE, SuperGLUE, XGLUE, and XTREME. The analysis shows that e.g. human level on SuperGLUE is still not reached, and there is still room for improvement for the current models.

研究动机与目标

  • 识别并解决 NLP 基准测试评分中的根本性缺陷:在任务复杂度、规模和数据泄露风险各不相同的任务上使用算术平均值。
  • 证明算术平均值会因未能惩罚特定任务上的低分而扭曲模型排名。
  • 提出并应用几何平均值和调和平均值作为多任务基准中归一化性能得分的更合适聚合方法。
  • 使用替代平均方法对 GLUE、SuperGLUE、XGLUE 和 XTREME 等主要 NLP 基准测试中的顶尖模型进行重新排序。
  • 倡导对基准测试实践进行重新设计,以实现更公平、更可靠的 NLP 模型评估。

提出的方法

  • 本文计算了新的综合得分,使用几何平均值(GM)和调和平均值(HM),分别定义为得分乘积的 N 次方根和 N 除以倒数之和。
  • 将这些指标应用于 GLUE、SuperGLUE、XGLUE 和 XTREME 中所有任务的公开报告模型得分,同时保留任务级别的性能数据。
  • 通过比较算术平均值(AM)、几何平均值和调和平均值下的排名,检测模型排序的变化。
  • 评估顶尖模型在统计特性(总和、方差和标准差)上的表现,以衡量其在各任务间的一致性和鲁棒性。
  • 对于 XGLUE 和 XTREME 等多语言基准测试,分析了两阶段平均方法(按语言分别平均,再跨任务平均)对综合得分的影响。
  • 对多语言基准测试中的人类表现进行外推,指出各任务间人类评估方法存在不一致。

实验结果

研究问题

  • RQ1用几何平均值或调和平均值替代算术平均值,对标准 NLP 基准测试中模型排名有何影响?
  • RQ2当采用更合适的平均方法时,当前 SOTA 模型在多大程度上接近或超越人类水平表现?
  • RQ3为何算术平均值会导致多任务 NLP 基准测试中模型比较产生偏差和误导?
  • RQ4测试集大小、数据泄露风险和任务年龄的差异如何影响基准测试得分的可靠性?
  • RQ5像几何平均值或调和平均值这样的替代聚合方法,能否更好地反映模型在多样化 NLP 任务中的均衡表现?

主要发现

  • 在 SuperGLUE 上,调和平均值和几何平均值的排名均将人类表现列为第一,DeBERTa 和 T5+Meena 模型分别位列第二和第三,落后人类 1.5–2%。
  • 在 GLUE 上,算术平均值将某模型排在第 16 名,但在几何平均值和调和平均值下该模型成为排名第一的模型,表明排名存在显著扭曲。
  • 人类在 SuperGLUE 上的总分(894.40)和方差(130.31)均高于顶尖模型,表明其在各任务上表现不一致但整体更优。
  • 排名前三的模型(DeBERTa、T5+Meena 和 McAlbert+DKM)的方差和标准差低于人类,表明其表现更一致但峰值性能较低。
  • 在 XGLUE 中,人类水平表现基于单语数据外推,但实际人类表现因语言而异,显著波动,削弱了该基准测试的有效性。
  • 本研究揭示,当前的基准测试范式导致了‘基准测试彩票’现象,即模型排名严重依赖于平均方法的选择,而非模型的真实能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。