Skip to main content
QUICK REVIEW

[论文解读] Utility is in the Eye of the User: A Critique of NLP Leaderboards

Kawin Ethayarajh, Dan Jurafsky|arXiv (Cornell University)|Sep 29, 2020
Topic Modeling参考文献 55被引用 13
一句话总结

本文批判了自然语言处理(NLP)排行榜在激励方向上与实际从业者需求脱节,因其过度强调模型准确率,而忽视了效率、公平性和延迟等实际因素。文章提出应在排行榜中透明披露模型规模、能耗和推理速度等信息,使用户能够基于自身需求计算个性化效用,并动态重排模型优先级。

ABSTRACT

Benchmarks such as GLUE have helped drive advances in NLP by incentivizing the creation of more accurate models. While this leaderboard paradigm has been remarkably successful, a historical focus on performance-based evaluation has been at the expense of other qualities that the NLP community values in models, such as compactness, fairness, and energy efficiency. In this opinion paper, we study the divergence between what is incentivized by leaderboards and what is useful in practice through the lens of microeconomic theory. We frame both the leaderboard and NLP practitioners as consumers and the benefit they get from a model as its utility to them. With this framing, we formalize how leaderboards -- in their current form -- can be poor proxies for the NLP community at large. For example, a highly inefficient model would provide less utility to practitioners but not to a leaderboard, since it is a cost that only the former must bear. To allow practitioners to better estimate a model's utility to them, we advocate for more transparency on leaderboards, such as the reporting of statistics that are of practical concern (e.g., model size, energy efficiency, and inference latency).

研究动机与目标

  • 识别NLP排行榜所激励的指标与从业者实际重视的模型特性之间的错配。
  • 分析当前排行榜设计为何未能反映模型效率、公平性和鲁棒性等实际关切。
  • 提出从仅基于性能的排名转向透明披露模型统计数据,以提升从业者对模型效用的估计能力。
  • 通过允许用户根据自身效用函数动态重排模型,实现个性化模型选择。
  • 倡导排行榜要求披露模型规模、能耗和延迟等实用指标,以支持更公平、可持续的模型采纳。

提出的方法

  • 将NLP从业者与排行榜均视为具有不同效用函数的经济消费者,运用基数效用理论比较其偏好。
  • 形式化当前排行榜的三大核心缺陷:效用非平滑(基于排名的奖励机制)、预测成本外部化(忽略推理成本)、缺乏对鲁棒性的考量。
  • 建议排行榜强制要求透明披露模型规模、能耗和推理延迟等实用指标。
  • 提出用户自定义排行榜的概念,允许用户为各项指标(如准确率、延迟、规模)分配权重,并动态重排模型。
  • 建议使用显现偏好理论,从实际模型使用模式中推断效用函数,尽管承认数据稀缺是主要挑战。
  • 倡导设置过滤选项,允许根据阈值(如参数量)排除模型,以提升资源有限的开发者的可及性。

实验结果

研究问题

  • RQ1NLP从业者与排行榜在评估模型质量时,其效用函数在哪些方面存在分歧?
  • RQ2为何当前NLP排行榜未能激励能源效率、公平性和鲁棒性提升,尽管这些在实践中至关重要?
  • RQ3在多大程度上,通过透明披露模型统计数据可提升从业者对模型实际效用的估计能力?
  • RQ4与仅基于准确率的静态排名相比,动态且用户可配置的排行榜在多大程度上更能反映个体或群体的特定优先级?
  • RQ5显现偏好或陈述偏好方法在估计多样化NLP用户群体效用函数方面可能发挥何种作用?

主要发现

  • 排行榜仅在准确率提升导致排名变化时才激励性能改进,造成效用非平滑;而从业者无论排名是否变化,均重视任何准确率的提升。
  • 排行榜忽视了推理成本(如模型规模、能耗、延迟),而这些因素对实际部署至关重要,显著降低了模型的实际效用。
  • 鲁棒性与公平性改进即使显著提升生产环境中的实用价值,也不会影响排行榜排名,导致激励错配。
  • 强制透明披露模型统计数据(如规模、能耗、延迟)可使从业者更准确估计模型效用,并做出更明智的权衡决策。
  • 支持指标加权的动态、用户可配置排行榜,可实现个性化模型选择,实质上实现‘为每位用户打造专属排行榜’。
  • 对最差群体表现等指标的透明披露,可激励开发者提升公平性,使模型开发更契合伦理与实际目标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。