Skip to main content
QUICK REVIEW

[论文解读] Data Banzhaf: A Robust Data Valuation Framework for Machine Learning

Tianhao Wang, Ruoxi Jia|arXiv (Cornell University)|May 30, 2022
Privacy-Preserving Technologies in Data被引用 10
一句话总结

本文提出 Data Banzhaf,一种用于机器学习的稳健数据估值框架,采用合作博弈论中的 Banzhaf 值为数据点分配价值。该框架引入了一个安全裕度度量,以量化对随机训练(如 SGD)导致的模型性能评分噪声的鲁棒性,表明 Banzhaf 值相比 Shapley 值或留一法(Leave-One-Out)值具有指数级更大的安全裕度。一种高效的最大样本重用(MSR)估计器实现了低样本复杂度的近似,并具备理论误差保证,在随机训练下的数据质量检测与重加权任务中优于现有方法。

ABSTRACT

Data valuation has wide use cases in machine learning, including improving data quality and creating economic incentives for data sharing. This paper studies the robustness of data valuation to noisy model performance scores. Particularly, we find that the inherent randomness of the widely used stochastic gradient descent can cause existing data value notions (e.g., the Shapley value and the Leave-one-out error) to produce inconsistent data value rankings across different runs. To address this challenge, we introduce the concept of safety margin, which measures the robustness of a data value notion. We show that the Banzhaf value, a famous value notion that originated from cooperative game theory literature, achieves the largest safety margin among all semivalues (a class of value notions that satisfy crucial properties entailed by ML applications and include the famous Shapley value and Leave-one-out error). We propose an algorithm to efficiently estimate the Banzhaf value based on the Maximum Sample Reuse (MSR) principle. Our evaluation demonstrates that the Banzhaf value outperforms the existing semivalue-based data value notions on several ML tasks such as learning with weighted samples and noisy label detection. Overall, our study suggests that when the underlying ML algorithm is stochastic, the Banzhaf value is a promising alternative to the other semivalue-based data value schemes given its computational advantage and ability to robustly differentiate data quality.

研究动机与目标

  • 解决由随机训练算法(如 SGD)引起的性能评分噪声导致的数据估值排名不稳定的挑战。
  • 通过新提出的度量——安全裕度,形式化数据估值的鲁棒性,定义为在保持数据价值排名不变的前提下,对效用评分的最大扰动量。
  • 识别在机器学习中现有数据价值概念里,具有最高安全裕度的半值(semivalue)。
  • 开发一种高效且理论基础坚实的 Banzhaf 值估计器,具备低样本复杂度和对性能评分噪声的鲁棒性。
  • 通过实证验证 Banzhaf 值在随机训练下的数据质量检测与重加权任务中优于现有方法。

提出的方法

  • 引入安全裕度作为鲁棒性的正式度量,量化在保持数据价值排名不变的前提下,对模型效用评分的最大扰动。
  • 理论化并证明 Banzhaf 值在所有半值中(包括 Shapley 值与留一法值)具有最大的安全裕度。
  • 提出一种基于最大样本重用(MSR)原理的 Banzhaf 值高效估计器,实现 $\ell_\infty$ 和 $\ell_2$ 误差保证,样本复杂度分别为对数级和近线性级。
  • 推导 Banzhaf 值估计的样本复杂度下限,并证明 MSR 估计器接近最优。
  • 证明 MSR 估计器对性能评分噪声具有鲁棒性,能保持稳定的价值排名。
  • 在真实世界机器学习任务中评估该框架,包括在 SGD 训练下的噪声标签检测与样本重加权。

实验结果

研究问题

  • RQ1随机梯度下降的固有随机性如何影响现有数据估值方法生成的数据价值排名的一致性?
  • RQ2是否存在一种形式化且数学严谨的方法,用于量化数据估值方法对性能评分噪声的鲁棒性?
  • RQ3在 Shapley、留一法与 Banzhaf 三种半值中,哪一种在效用评分受噪声影响时具有最高的安全裕度?
  • RQ4能否构建一种高效且精确的 Banzhaf 值估计器,具备可证明的误差界和低样本复杂度?
  • RQ5Banzhaf 值是否能在随机训练下的实际机器学习应用(如数据质量评估与重加权)中保持稳定排名并优于现有方法?

主要发现

  • Banzhaf 值相比 Shapley 值与留一法误差,具有指数级更大的安全裕度,表明其在应对随机训练导致的性能评分噪声方面显著更鲁棒。
  • Banzhaf 值的安全裕度在所有半值中最大,证实其在扰动下保持一致数据价值排名的理论优越性。
  • 所提出的 Banzhaf 值 MSR 估计器实现了 $\ell_\infty$ 误差的对数样本复杂度和 $\ell_2$ 误差的近线性样本复杂度,接近理论下限。
  • 实证评估表明,Data Banzhaf 在 SGD 训练下检测噪声标签与重加权样本方面优于 Shapley、LOO 与 Beta Shapley 方法。
  • 即使在效用评分加入高斯噪声时,该框架仍能保持稳定排名,多轮实验中斯皮尔曼等级相关系数保持较高水平。
  • Banzhaf 值的鲁棒性在不同随机优化方法中均成立,包括带随机平滑的梯度下降,证实其在 SGD 之外也具备广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。