Skip to main content
QUICK REVIEW

[论文解读] Computing a Data Dividend

Eric Bax|arXiv (Cornell University)|May 6, 2019
Auction Theory and Applications参考文献 19被引用 4
一句话总结

本文提出了一种方法,通过使用Shapley值和Owen值为单个数据样本及其组合分配货币价值,实现数据红利的公平计算。该方法证明,尽管这些值的定义具有指数级复杂度,但其计算可在多项式时间内完成,从而实现了在机器学习和统计学中对数据驱动决策所产生的利润进行实际分配。

ABSTRACT

Quality data is a fundamental contributor to success in statistics and machine learning. If a statistical assessment or machine learning leads to decisions that create value, data contributors may want a share of that value. This paper presents methods to assess the value of individual data samples, and of sets of samples, to apportion value among different data contributors. We use Shapley values for individual samples and Owen values for combined samples, and show that these values can be computed in polynomial time in spite of their definitions having numbers of terms that are exponential in the number of samples.

研究动机与目标

  • 为数据驱动产业中日益增长的数据贡献者公平补偿需求提供解决方案。
  • 开发一种机制,公平地在个人贡献者和数据联盟之间分配由数据产生的利润。
  • 确保尽管传统Shapley值和Owen值定义具有指数级性质,其数据估值仍具有计算可行性。
  • 为广告、金融预测和临床研究等应用提供一个原则性、基于博弈论的数据红利计算框架。

提出的方法

  • 使用Shapley值计算单个数据样本对决策过程的边际贡献。
  • 应用Owen值评估数据样本联盟的贡献,特别是在最近邻分类模型中的应用。
  • 通过排列的组合平均法高效计算Shapley值和Owen值,将指数级复杂度降低为多项式时间。
  • 基于概率加权贡献,推导出频率模型和最近邻模型中数据红利计算的闭式表达式。
  • 引入如$\hat{f}_{m,i}(x,y)$和$\hat{g}_{m,i}(x,y)$等术语,表示分类任务中样本在联盟内的贡献。
  • 利用对称性和排列不变性对值计算中的项进行分组与简化,实现可扩展的评估。

实验结果

研究问题

  • RQ1在数据驱动的决策系统中,如何对单个数据样本进行公平估值?
  • RQ2在机器学习模型中,为数据贡献分配Shapley值和Owen值的计算可行性如何?
  • RQ3尽管标准定义中存在指数级项数,是否可以开发出多项式时间算法来计算数据红利?
  • RQ4当多个样本由同一来源或群体贡献时,数据红利应如何分配?
  • RQ5数据红利计算对数据收集中的公平性、隐私和不平等问题有何影响?

主要发现

  • 个体数据样本的Shapley值和联盟的Owen值均可在多项式时间内计算,克服了其标准定义的指数级复杂度。
  • 该方法实现了在广告、金融预测和临床研究等应用中,对数据驱动决策产生的利润进行公平且计算高效的分配。
  • 在最近邻分类中,样本的贡献通过基于其在排列中的位置和投票结果的概率加权边际收益推导得出。
  • 该框架支持频率模型和最近邻模型,使其在机器学习和统计决策系统中具有广泛适用性。
  • 该方法为数据红利系统提供了基础,可通过补偿代表性或高影响力的数据贡献者,减少偏差并提升公平性。
  • 本文指出潜在风险,如数据欺诈和隐私权衡,建议通过数据验证和公平补偿机制来维护系统完整性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。