Skip to main content
QUICK REVIEW

[论文解读] Beta Shapley: a Unified and Noise-reduced Data Valuation Framework for Machine Learning

Yongchan Kwon, James Zou|arXiv (Cornell University)|Oct 26, 2021
Machine Learning and Data Classification参考文献 36被引用 21
一句话总结

本文提出 Beta Shapley,一种统一且降噪的数据价值评估框架,通过放松 Shapley 值的效率公理来推广 Data Shapley。通过基于 Beta 分布对边际贡献进行加权——尤其侧重小规模子集——该方法在检测错误标注数据、子采样以及数据增删任务中表现出更低的噪声和更优的性能,优于 Data Shapley 和当前最先进方法在多个基准测试中的表现。

ABSTRACT

Data Shapley has recently been proposed as a principled framework to quantify the contribution of individual datum in machine learning. It can effectively identify helpful or harmful data points for a learning algorithm. In this paper, we propose Beta Shapley, which is a substantial generalization of Data Shapley. Beta Shapley arises naturally by relaxing the efficiency axiom of the Shapley value, which is not critical for machine learning settings. Beta Shapley unifies several popular data valuation methods and includes data Shapley as a special case. Moreover, we prove that Beta Shapley has several desirable statistical properties and propose efficient algorithms to estimate it. We demonstrate that Beta Shapley outperforms state-of-the-art data valuation methods on several downstream ML tasks such as: 1) detecting mislabeled training data; 2) learning with subsamples; and 3) identifying points whose addition or removal have the largest positive or negative impact on the model.

研究动机与目标

  • 为解决 Data Shapley 的局限性,特别是其因对所有子集规模均匀平均而产生的高方差问题。
  • 开发一个统一的框架,将多种数据价值评估方法(包括 LOO 和 Data Shapley)统一在一种原则性方法之下。
  • 提升在实际机器学习任务(如噪声标签检测和主动数据选择)中的统计鲁棒性和性能。
  • 证明小规模子集的边际贡献具有更高的信噪比,从而为非均匀加权方案提供理论依据。
  • 提出一种基于蒙特卡洛的高效算法,实现在大规模场景下对 Beta Shapley 值的可扩展估计。

提出的方法

  • Beta Shapley 通过放松 Shapley 值的效率公理来推广 Data Shapley,允许对边际贡献采用灵活的加权方案。
  • 它使用 Beta 分布为不同子集规模的边际贡献分配权重,其中参数 α 和 β 控制对小规模或大规模子集的侧重程度。
  • 该框架被推导为一种半值(semivalue),即对 Shapley 值的推广,保留了公平性和对称性,但舍弃了效率公理。
  • 提出一种高效的蒙特卡洛采样算法,通过按 Beta 权重概率采样不同大小的子集,以估计 Beta Shapley 值。
  • 该方法支持正负数据价值,可识别有害或噪声数据点。
  • 理论分析表明,与 Data Shapley 相比,Beta Shapley 具有更低的统计噪声,尤其在优先考虑小规模子集贡献时更为显著。

实验结果

研究问题

  • RQ1放松 Shapley 值的效率公理是否能带来在机器学习中更鲁棒且更有效的数据价值评估框架?
  • RQ2小规模子集的边际贡献是否比大规模子集具有更高的信噪比?
  • RQ3基于 Beta 加权边际贡献的统一框架是否能在真实世界机器学习任务中超越现有方法(如 Data Shapley 和 LOO)?
  • RQ4在数据价值评估中,边际贡献的最优加权方案是什么?其与机器学习任务或数据分布的关系如何?
  • RQ5如何利用蒙特卡洛采样在大规模场景下高效估计 Beta Shapley 值,同时保持统计准确性?

主要发现

  • Beta(16,1) 通过强调小规模子集的边际贡献,在检测错误标注数据和数据增补实验中表现最佳,15 个数据集上的平均准确率提升达 0.757。
  • 在数据增补任务中,Beta(16,1) 超过了 Data Shapley(Beta(1,1))和 LOO,表现出在选择高价值数据点时模型准确率提升更快且更稳定。
  • 在数据删除任务中,Data Shapley 略优于其他方法,因为其均匀加权能更有效地捕捉大规模子集删除的影响。
  • 在 German 数据集上,该方法实现了 0.872 ± 0.004 的 F1 分数,优于 LOO 和其他基线方法,在噪声标签检测任务中表现更优。
  • 在子采样任务中,Beta Shapley 使用 Beta(4,1) 和 Beta(16,1) 表现最佳,在 Vehicle 数据集上达到 0.772 ± 0.004 的准确率,显著优于均匀采样。
  • 图 7 的热力图证实,在 15 个数据集中的 12 个任务中,Beta(16,1) 是表现最佳的方法,其最佳性能的线性缩放频率为 0.757。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。