[论文解读] Data Pricing in Machine Learning Pipelines
本文综述了机器学习流水线中的数据定价原则,重点关注三个关键阶段:训练数据收集、协作模型训练和模型部署。通过博弈论方法(如Shapley值)提出原始数据、标注数据和模型贡献的合理定价机制,同时识别出端到端收入分配、对数据复制的鲁棒性、竞争市场中的基于查询的定价以及严格评估框架等方面的挑战。
Machine learning is disruptive. At the same time, machine learning can only succeed by collaboration among many parties in multiple steps naturally as pipelines in an eco-system, such as collecting data for possible machine learning applications, collaboratively training models by multiple parties and delivering machine learning services to end users. Data is critical and penetrating in the whole machine learning pipelines. As machine learning pipelines involve many parties and, in order to be successful, have to form a constructive and dynamic eco-system, marketplaces and data pricing are fundamental in connecting and facilitating those many parties. In this article, we survey the principles and the latest research development of data pricing in machine learning pipelines. We start with a brief review of data marketplaces and pricing desiderata. Then, we focus on pricing in three important steps in machine learning pipelines. To understand pricing in the step of training data collection, we review pricing raw data sets and data labels. We also investigate pricing in the step of collaborative training of machine learning models, and overview pricing machine learning models for end users in the step of machine learning deployment. We also discuss a series of possible future directions.
研究动机与目标
- 建立涉及多个协作方的机器学习流水线中合理化数据定价机制。
- 解决将数据作为非竞争性、组合性且异质性资产时所面临的独特定价挑战,其价值在不同买家之间存在差异。
- 综述并分析原始数据集、数据标注、协作模型贡献以及已部署机器学习模型的定价方法。
- 识别在端到端收入分配、估值的公理基础、细粒度数据采购以及定价模型评估方面存在的关键研究空白。
- 倡导建立系统性框架,以支持机器学习生态系统中动态、公平且稳健的数据与模型交换。
提出的方法
- 综述现有数据市场与定价需求的研究,重点关注三个流水线阶段:数据收集、协作训练和部署。
- 应用合作博弈论,特别是Shapley值,以量化和定价协作模型训练中的贡献。
- 基于对称性、可加性和零元素等公理评估定价模型,并与归一化Banzhaf值等替代方法进行比较。
- 提出基于查询的定价模型,以在多卖方环境中实现选择性数据获取,从而提升数据多样性与预算效率。
- 建议开发仿真平台,以在包括对抗行为和联盟策略在内的现实市场行为下评估定价模型。
- 在定价模型设计中整合真实性、收入最大化和无套利性等原则。

实验结果
研究问题
- RQ1如何实现一种公平反映数据对多样化买家的机器学习模型性能贡献的数据定价方式?
- RQ2哪些博弈论机制可确保在协作模型训练中贡献者之间公平且稳健的收入分配?
- RQ3定价模型如何在存在重叠数据集的多卖方竞争市场中,支持细粒度的基于查询的数据采购?
- RQ4当现实行为(如串通或策略性出价)破坏理想化假设时,现有定价模型存在哪些局限性?
- RQ5如何系统性地设计从数据收集到模型部署的完整机器学习流水线中的端到端收入分配?
主要发现
- Shapley值在协作训练中的基于贡献的定价中被广泛使用,但由于其依赖可加性公理,在所有市场情境下未必最优。
- 与Shapley值相比,归一化Banzhaf值对数据复制攻击具有更强的鲁棒性,表明估值方法的适用性具有情境依赖性。
- 现有定价模型通常假设参与者为理性且非联盟行为,但当前研究对现实市场动态(如对抗行为或联盟行为)的评估仍显不足。
- 目前缺乏系统性框架来实现涵盖机器学习流水线所有阶段贡献的端到端收入分配。
- 基于查询的定价模型虽已存在,但目前仅限于垄断环境,尚需扩展至多卖方、竞争性数据市场。
- 定价模型的严格评估仍不充分,多数研究依赖过于简化的假设;需借助仿真平台实现对现实性能的评估。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。