[论文解读] A Coupled Design of Exploiting Record Similarity for Practical Vertical Federated Learning
该论文提出 FedSim,一种用于纵向联邦学习(VFL)的新型耦合训练框架,通过利用模糊标识符之间的相似度得分,将一对一记录关联与模型训练相结合。通过根据相似度动态加权关联记录,并在训练过程中调整这些权重,FedSim 在模糊关联和精确关联场景下均提升了性能,在八个数据集上均优于最先进基线方法,同时提供了隐私分析,并针对一种提出的贪婪推理攻击提供了防御机制。
Federated learning is a learning paradigm to enable collaborative learning across different parties without revealing raw data. Notably, vertical federated learning (VFL), where parties share the same set of samples but only hold partial features, has a wide range of real-world applications. However, most existing studies in VFL disregard the "record linkage" process. They design algorithms either assuming the data from different parties can be exactly linked or simply linking each record with its most similar neighboring record. These approaches may fail to capture the key features from other less similar records. Moreover, such improper linkage cannot be corrected by training since existing approaches provide no feedback on linkage during training. In this paper, we design a novel coupled training paradigm, FedSim, that integrates one-to-many linkage into the training process. Besides enabling VFL in many real-world applications with fuzzy identifiers, FedSim also achieves better performance in traditional VFL tasks. Moreover, we theoretically analyze the additional privacy risk incurred by sharing similarities. Our experiments on eight datasets with various similarity metrics show that FedSim outperforms other state-of-the-art baselines. The codes of FedSim are available at https://github.com/Xtra-Computing/FedSim.
研究动机与目标
- 为解决现有 VFL 系统依赖精确匹配或一对一记录关联的局限性,这些方法无法捕捉到相似度较低但相关性较高的记录的关键特征。
- 克服将关联与训练过程分离所导致的性能下降问题,该问题阻碍了模型优化对关联质量的反馈改进。
- 设计一种可扩展的、具备隐私意识的 VFL 框架,支持现实应用中常见的模糊标识符(如地址、GPS 坐标、标题等)。
- 分析共享相似度得分所引入的隐私风险,并提出具有攻击成功概率理论边界的防御机制。
- 在具有不同相似度度量方式的多样化数据集上,证明 FedSim 在性能上优于最先进 VFL 基线方法。
提出的方法
- FedSim 提出一种耦合训练范式,联合优化模型权重与基于相似度的关联权重,采用一种关注相似度的损失函数,优先考虑高相似度关联记录。
- 扩展 SplitNN 架构,使从属方能够向主方发送中间表示,同时在聚合过程中将相似度得分作为可学习的注意力权重引入。
- 该框架根据每条关联记录与目标记录的相似度动态调整其贡献,通过迭代更新权重以最小化训练损失。
- 为保护隐私,FedSim 在共享前对相似度得分应用高斯噪声,并在差分隐私框架下分析风险,表明其不足以提供强隐私保证。
- 提出一种贪婪推理攻击以测试隐私安全性,并引入一种防御机制,通过理论分析限制该攻击的成功率。
- 通过为每个目标选择最相似的前 K 条记录,支持一对多关联,在效率与信息保留之间实现平衡。
实验结果
研究问题
- RQ1是否能够通过将基于相似度的一对多关联与训练过程耦合,使纵向联邦学习的性能超越一对一或全连接式关联?
- RQ2将相似度得分整合进训练过程,对具有模糊标识符的 VFL 中模型准确率与收敛性有何影响?
- RQ3在 VFL 中共享相似度得分会引入何种隐私风险?能否对其进行定量边界约束?
- RQ4所提出的框架是否能在具有不同相似度度量方式的多样化真实世界数据集上,持续优于现有最先进 VFL 基线?
- RQ5该框架是否可扩展至多方 VFL?其可扩展性需要满足哪些假设?
主要发现
- FedSim 在八个数据集上均优于最先进 VFL 基线,包括住房价格预测和游戏推荐等真实世界应用,准确率持续提升。
- 在 GPS 坐标和游戏标题等模糊标识符场景下,该框架实现了显著的性能提升,而传统一对一关联方法无法捕捉相关特征。
- 在具有精确标识符的数据集上,FedSim 与基线方法性能相当,但若 K 值过大则可能出现性能下降,表明其对超参数选择较为敏感。
- 所提出的贪婪攻击可基于相似度得分以非可忽略的成功概率推断出标识符,验证了在相似度共享系统中隐私保护的必要性。
- 理论分析对贪婪攻击的成功率进行了边界约束,且防御机制在现实假设下有效降低了成功推断的概率。
- 在主方持有更具信息量特征的假设下,FedSim 可扩展至多方 VFL,且可实现从属方的一对一关联,不会造成性能损失。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。