[论文解读] Benchmark Data Repositories for Better Benchmarking
本文提出,基准数据存储库应被设计为第一流的研究基础设施,以改善机器学习基准测试实践。通过嵌入持久标识符、标准化元数据和版本控制,存储库可解决数据集过度使用、可复现性差以及数据贡献被低估等问题,从而提升机器学习研究评估的严谨性、公平性和可持续性。
In machine learning research, it is common to evaluate algorithms via their performance on standard benchmark datasets. While a growing body of work establishes guidelines for -- and levies criticisms at -- data and benchmarking practices in machine learning, comparatively less attention has been paid to the data repositories where these datasets are stored, documented, and shared. In this paper, we analyze the landscape of these $ extit{benchmark data repositories}$ and the role they can play in improving benchmarking. This role includes addressing issues with both datasets themselves (e.g., representational harms, construct validity) and the manner in which evaluation is carried out using such datasets (e.g., overemphasis on a few datasets and metrics, lack of reproducibility). To this end, we identify and discuss a set of considerations surrounding the design and use of benchmark data repositories, with a focus on improving benchmarking practices in machine learning.
研究动机与目标
- 通过将基准存储库定位为认可数据集作为知识贡献的平台,解决机器学习中对数据工作的低估问题。
- 识别当前基准测试实践中系统性缺陷,包括对少数数据集的过度依赖、可复现性不足以及文档不充分。
- 提出基准存储库的具体设计原则,以改善数据集的可发现性、引用、版本控制和伦理合规性。
- 将存储库层面的实践与数据中心人工智能中的更广泛问题联系起来,如代表性伤害和建构效度问题。
- 建立基准存储库设计的最佳实践框架,支持数据集生命周期的全过程——从创建到重用。
提出的方法
- 提出术语“基准数据存储库”,以区分专注于评估数据集的存储库与通用数据存储库。
- 倡导使用持久标识符(例如 DOI)以实现数据集的可靠引用和归因,减少对仅引用相关论文的依赖。
- 引入“关联元数据”概念,将数据集与其原始来源、方法和评估上下文相连接,以提升可追溯性和可复现性。
- 建议采用与社区标准(如 DataCite)一致的标准化元数据模式,以确保跨存储库的一致性和机器可读性。
- 提出版本控制和血缘追踪机制,以支持可复现性,并随时间检测数据集漂移或分布变化。
- 强调存储库在强制执行许可和同意合规性方面的作用,尤其针对包含敏感数据或 PII 的数据集。
实验结果
研究问题
- RQ1如何设计基准数据存储库以更好地支持可复现且公平的机器学习基准测试?
- RQ2持久标识符和标准化元数据在改善数据集引用以及将数据视为学术贡献的认可方面发挥什么作用?
- RQ3当前基准测试实践在哪些方面因过度依赖少数数据集和指标而失败?
- RQ4基准存储库在检测和缓解评估数据集中的代表性伤害和建构效度问题方面可发挥何种作用?
- RQ5存储库可实施哪些制度和技术机制,以确保伦理数据使用并符合许可和同意标准?
主要发现
- 持久标识符(如 DOI)对于实现数据集的正确引用、并认可数据创建者作为学术研究的一流贡献者至关重要。
- 许多存储库缺乏标准化元数据和版本控制,这会损害可复现性,并使得追踪数据集演化或检测分布变化变得困难。
- 基准存储库可作为强制执行数据共享最佳实践的核心基础设施,包括许可、同意和伦理审查,尤其适用于敏感数据。
- 当前的基准测试实践往往偏向少数广泛使用数据集,这可能导致过拟合和泛化能力有限,而存储库可通过注重多样性的数据集遴选帮助缓解此问题。
- 支持关联元数据和血缘追踪的存储库显著提升了基准评估的透明度和可审计性。
- 将引用、版本控制和许可功能整合到存储库中,可激励在整个机器学习研究生命周期中提升数据集整理和文档质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。