[论文解读] Incentivizing Data Contribution in Cross-Silo Federated Learning
本文提出了一种跨孤岛联邦学习中的利润分配激励框架,以应对由隐私驱动的免费搭车行为,通过将财务回报与数据贡献相匹配来实现。基于博弈论模型,研究表明,诸如留一法(LOO)和Shapley值等机制能有效激励高质量数据共享,其中LOO在均衡状态下实现了最高的全局模型准确率。
In cross-silo federated learning, clients (e.g., organizations) train a shared global model using local data. However, due to privacy concerns, the clients may not contribute enough data points during training. To address this issue, we propose a general incentive framework where the profit/benefit obtained from the global model can be appropriately allocated to clients to incentivize data contribution. We formulate the clients' interactions as a data contribution game and study its equilibrium. We characterize conditions for an equilibrium to exist, and prove that each client's equilibrium data contribution increases in its data quality and decreases in the privacy sensitivity. We further conduct experiments using CIFAR-10 and show that the results are consistent with the analysis. Moreover, we show that practical allocation mechanisms such as linearly proportional, leave-one-out, and Shapley-value incentivize more data contribution from clients with higher-quality data, in which leave-one-out tends to achieve the highest global model accuracy at equilibrium.
研究动机与目标
- 解决跨孤岛联邦学习中的免费搭车问题,即组织因隐私担忧而隐瞒数据。
- 设计一个通用的激励框架,根据客户端的数据贡献度分配全局模型的利润。
- 分析客户端异质性(数据质量、数据容量和隐私敏感度)对战略性数据贡献决策的影响。
- 评估实际的利润分配机制(如LOO、Shapley值、线性比例分配)在激励高质量数据贡献方面的能力。
- 建立均衡存在性的理论条件,并刻画数据贡献博弈中均衡行为的特征。
提出的方法
- 将客户端互动建模为非合作数据贡献博弈,客户端战略性地选择数据贡献水平以最大化自身效用。
- 将全局模型性能建模为数据质量和贡献的函数,其中隐私敏感度会降低增加数据贡献的边际收益。
- 引入一种利润分配机制,根据基于模型性能指标计算出的贡献指数,将训练后的利润进行分配。
- 使用留一法(LOO)和Shapley值方法计算贡献指数,确保公平性与策略鲁棒性。
- 提出一种最佳响应算法,在较弱条件下计算博弈的纳什均衡。
- 通过在CIFAR-10上的数值实验验证理论发现,测量不同机制和客户端异质性下的全局模型准确率。
实验结果
研究问题
- RQ1如何设计利润分配机制,以在隐私担忧下激励客户端贡献足够数据?
- RQ2在异质客户端之间,数据贡献博弈中纳什均衡存在的条件是什么?
- RQ3数据质量、数据容量和隐私敏感度如何影响均衡状态下的数据贡献水平?
- RQ4在线性比例分配、留一法(LOO)和Shapley值三种机制中,哪种最能激励高质量数据贡献?
- RQ5不同机制对均衡状态下最终全局模型准确率有何影响?
主要发现
- 在较弱条件下,数据贡献博弈中存在均衡,且每个客户端的均衡数据贡献水平随其数据质量与数据容量的提高而上升,但随隐私敏感度的增加而下降。
- 留一法(LOO)机制始终能诱导最高的总数据贡献量,并在均衡状态下实现最佳的全局模型准确率,优于均等分配、线性比例分配和Shapley值机制。
- 线性比例(LP)和Shapley值(SV)机制能激励高质量数据客户端贡献更多数据,但其全局性能未达到LOO水平。
- 当客户端数据质量相同时,LOO导致贡献不均衡(少数高质量客户端贡献大部分数据),而LP和SV则产生更均衡的贡献分布。
- 随着标签噪声增加和隐私敏感度提高,全局模型准确率下降,因为这两个因素均会降低数据贡献水平。
- LOO在检测和阻止数据重复方面最为有效,因为重复数据对模型性能贡献极低,从而导致利润分成也极低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。