[论文解读] AI and the Everything in the Whole Wide World Benchmark
本文批判了将流行的人工智能基准测试(被包装为通用智能的衡量标准)视为本质上有缺陷的做法,因其范围人为且对普遍性的宣称不实。文章认为,这些基准测试,如虚构的‘全世界博物馆’,本质上是有限的、依赖特定语境的,并且在衡量人工智能广泛能力方面在建构上无效。文章主张转向基于上下文的评估方法,如系统性测试套件、行为测试和消融分析,以提升人工智能评估的透明度与可靠性。
There is a tendency across different subfields in AI to valorize a small collection of influential benchmarks. These benchmarks operate as stand-ins for a range of anointed common problems that are frequently framed as foundational milestones on the path towards flexible and generalizable AI systems. State-of-the-art performance on these benchmarks is widely understood as indicative of progress towards these long-term goals. In this position paper, we explore the limits of such benchmarks in order to reveal the construct validity issues in their framing as the functionally "general" broad measures of progress they are set up to be.
研究动机与目标
- 挑战一种普遍假设,即少数广泛采用的基准测试(如 GLUE、ImageNet)能够代表通用人工智能能力。
- 揭示将狭窄且有限的基准测试视为人工智能进步普遍衡量标准时所存在的建构效度问题。
- 指出这些基准测试中存在偏差或非代表性数据,可能掩盖模型在不同人口群体中性能差异的问题。
- 倡导评估范式的转变:从广泛但具有误导性的基准测试,转向有针对性的、上下文特定的、基于行为的评估技术。
- 将基准测试重新定义为理解系统行为的工具,而非通用智能的代理指标。
提出的方法
- 分析通用任务框架(CTF)的历史演变及其向现代基准测试的转化过程,以及其被误用为通用能力代理的机制。
- 在概念上将虚构的‘全世界博物馆’与人工智能基准测试进行类比,揭示其声称代表普遍智能,实则本质上是有限且选择性的本质。
- 提出替代性评估方法,如系统性测试套件、审计和对抗性测试,以探测特定的故障模式与偏见。
- 倡导行为测试,包括分解分析、反事实分析和错误分析,以揭示标准基准测试中无法察觉的模型缺陷。
- 引入消融测试,以隔离模型各组件的贡献,评估其功能角色。
- 建议采用正交评估技术,如能效分析、内存占用测量以及对数据扰动的鲁棒性测试,以评估超越准确率的系统属性。
实验结果
研究问题
- RQ1为何尽管被广泛采用,流行的人工智能基准测试仍无法作为衡量通用人工智能能力的有效指标?
- RQ2为何将基准测试框定为‘通用’会引发人工智能评估中的建构效度问题?
- RQ3基准测试中存在偏差或非代表性训练与测试数据,在哪些方面会掩盖模型在不同人口子群体中性能的差异?
- RQ4哪些替代性评估方法能比聚合基准分数提供更深刻的模型行为洞察?
- RQ5如何使评估实践从营造虚假的普遍性感觉,转向实现透明、上下文感知且可操作的系统分析?
主要发现
- 像 GLUE 和 ImageNet 这类流行基准测试,由于其有限性、上下文特定性以及常常具有任意的设计,无法代表通用智能。
- 声称这些基准测试上的表现代表向通用人工智能迈进的进展,在建构上是无效的,因为它们并未真正衡量所宣称的广度或适应能力。
- 在存在偏差的基准测试上获得的聚合性能分数,可能掩盖模型在代表性不足的人口群体中性能的显著差异。
- 替代性评估方法,如对抗性测试、分解分析和反事实分析,能够揭示标准基准测试中无法察觉的故障模式与偏见。
- 消融测试与系统属性分析(如能效、内存占用)可提供超越准确率指标的模型行为与可靠性更深层次洞察。
- 该领域应摒弃‘通用基准’的神话,转而采用有针对性的、上下文感知的评估框架,以提升人工智能开发的透明度与问责性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。