Skip to main content
QUICK REVIEW

[论文解读] Fair and efficient contribution valuation for vertical federated learning

Zhenan Fan, Fang Huang|arXiv (Cornell University)|Jan 7, 2022
Privacy-Preserving Technologies in Data被引用 15
一句话总结

本文提出垂直联邦沙普利值(VerFedSV),一种公平且高效的垂直联邦学习(VFL)贡献评估方法,可在无需完整模型微调的情况下计算客户端贡献。通过利用多个训练时间点的客户端嵌入及矩阵补全技术,VerFedSV 满足关键公平性公理,并适用于同步与异步 VFL,实现高效且准确的奖励分配,真实反映数据质量与通信频率。

ABSTRACT

Federated learning is an emerging technology for training machine learning models across decentralized data sources without sharing data. Vertical federated learning, also known as feature-based federated learning, applies to scenarios where data sources have the same sample IDs but different feature sets. To ensure fairness among data owners, it is critical to objectively assess the contributions from different data sources and compensate the corresponding data owners accordingly. The Shapley value is a provably fair contribution valuation metric originating from cooperative game theory. However, its straight-forward computation requires extensively retraining a model on each potential combination of data sources, leading to prohibitively high communication and computation overheads due to multiple rounds of federated learning. To tackle this challenge, we propose a contribution valuation metric called vertical federated Shapley value (VerFedSV) based on the classic Shapley value. We show that VerFedSV not only satisfies many desirable properties of fairness but is also efficient to compute. Moreover, VerFedSV can be adapted to both synchronous and asynchronous vertical federated learning algorithms. Both theoretical analysis and extensive experimental results demonstrate the fairness, efficiency, adaptability, and effectiveness of VerFedSV.

研究动机与目标

  • 为解决垂直联邦学习(VFL)中数据所有者在共享样本上贡献不同特征所带来的公平且高效的贡献评估挑战。
  • 克服在 VFL 中精确沙普利值计算的高昂计算成本,后者需要在所有客户端子集上重新训练模型。
  • 设计一种方法,在保持沙普利值公平性属性(对称性、可加性、零元素、平衡性)的同时,可扩展至真实世界的 VFL 系统。
  • 确保在同步与异步 VFL 训练协议中均具备适应性,真实反映数据质量与客户端计算投入。
  • 通过实证验证,VerFedSV 能够准确地为数据质量更高和参与更积极的客户端分配更高估值。

提出的方法

  • 提出 VerFedSV,一种基于沙普利值的新型贡献评估指标,通过在多个训练时间点利用客户端嵌入计算边际贡献,专为 VFL 优化。
  • 在同步 VFL 中,利用矩阵补全技术高效估算所有客户端子集的全局模型性能,避免完整重训。
  • 利用带时间戳的客户端嵌入,近似计算每个客户端在所有可能客户端联盟中的贡献。
  • 设计一种动态估值框架,在训练过程中逐步计算贡献,降低通信与计算开销。
  • 将该方法应用于同步与异步 VFL:在异步环境中,其不仅反映数据相关性,还将客户端通信频率作为计算投入的代理指标。
  • 采用递归聚合机制,通过在每个估值时间点组合各客户端的增量贡献,高效计算 VerFedSV。

实验结果

研究问题

  • RQ1能否在无需完整模型微调的前提下,高效计算基于沙普利值的贡献评估指标?
  • RQ2所提出的方法是否在 VFL 环境中保持公平性公理(对称性、可加性、零元素、平衡性)?
  • RQ3在异步 VFL 环境中,VerFedSV 如何反映数据质量与通信频率的差异?
  • RQ4VerFedSV 是否能在同步与异步 VFL 训练协议中均实现高效计算?
  • RQ5VerFedSV 在多大程度上能为数据质量更高和参与更积极的客户端分配更高估值?

主要发现

  • VerFedSV 在理论上满足沙普利值的全部四项公平性公理——对称性、可加性、零元素与平衡性,如定理 1 所证明。
  • 在实验中,仅随机生成特征的客户端获得的 VerFedSV 不足总值的 0.4%,证实只有有意义的数据才对估值有贡献。
  • 通信频率更高的客户端获得了成比例更高的 VerFedSV:例如在 Adult 数据集中,通信频率最高的客户端获得了 93% 的人工客户端估值(特征完全相同)。
  • 在异步环境中,VerFedSV 准确反映了客户端的计算投入,估值随通信频率线性增长,即使数据质量相同亦然。
  • 在 Adult 数据集中,普通客户端合计获得了 97.91% 的总 VerFedSV,而具有随机特征的人工客户端仅获得 2.09%,表明其对数据质量具有高度敏感性。
  • VerFedSV 实现了无需完整模型微调的高效贡献评估,使其在通信与计算成本高昂的大规模 VFL 系统中具备实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。