[论文解读] Fishing for User Data in Large-Batch Federated Learning via Gradient Magnification
本文提出了一种模型无关的梯度放大攻击,通过操纵服务器更新来隔离并提取单个用户的数据点,从而在大规模批量联邦学习中引发隐私泄露。该方法无需架构修改,仅需修改发送给用户的模型参数,即使在批量大小高达256时也能实现高保真度的数据重建,揭示了跨设备和跨存储库场景下的关键隐私漏洞。
Federated learning (FL) has rapidly risen in popularity due to its promise of privacy and efficiency. Previous works have exposed privacy vulnerabilities in the FL pipeline by recovering user data from gradient updates. However, existing attacks fail to address realistic settings because they either 1) require toy settings with very small batch sizes, or 2) require unrealistic and conspicuous architecture modifications. We introduce a new strategy that dramatically elevates existing attacks to operate on batches of arbitrarily large size, and without architectural modifications. Our model-agnostic strategy only requires modifications to the model parameters sent to the user, which is a realistic threat model in many scenarios. We demonstrate the strategy in challenging large-scale settings, obtaining high-fidelity data extraction in both cross-device and cross-silo federated learning.
研究动机与目标
- 解决现有联邦学习隐私攻击在大规模批量下失效或需要不切实际的架构修改的问题。
- 研究不受信任的服务器更新威胁模型,即服务器向用户发送恶意构造的模型参数。
- 开发一种实用的、模型无关的攻击方法,可在不修改客户端模型的前提下,从任意大规模批量中实现高保真度的数据提取。
- 在跨设备和跨存储库联邦学习场景中,证明该攻击的可行性和有效性。
- 揭示隐私攻击的非对称影响,表明异常值和代表性不足的数据点更加脆弱。
提出的方法
- 该攻击通过操纵服务器的模型更新,放大目标数据点的梯度贡献,同时抑制批次中其他数据点的梯度贡献。
- 使用经过精心设计的参数向量,使目标样本在梯度更新中占据主导地位,从而在反演过程中实现隔离。
- 该方法为模型无关,仅需修改发送给用户的模型参数,无需更改模型架构或训练过程。
- 通过梯度放大,使现有基于优化和分析的反演技术(如APRIL)能够应用于大规模批量梯度。
- 该攻击在跨设备和跨存储库设置中均被应用,实验基于ViT和CNN进行图像分类。
- 实现了从批量大小为256的批次中恢复单个数据点,而先前方法因梯度混合而失效。
实验结果
研究问题
- RQ1是否可以在不修改架构的前提下,将梯度反演攻击扩展到任意大规模批量的联邦学习中?
- RQ2仅通过修改服务器的模型更新,是否能够从大规模批量梯度中提取单个数据点?
- RQ3所提出的梯度放大策略在跨设备和跨存储库联邦学习设置中的有效性如何?
- RQ4该攻击对具有极端特征值的数据点有何影响?是否对代表性不足的群体产生非对称影响?
- RQ5标准聚合防御机制(如中值聚合)是否能有效缓解此攻击?
主要发现
- 所提出的钓鱼攻击成功从批量大小高达256的批量中恢复出高保真度图像,在ViT-Small上于ImageNet上达到21.481的Max-RPSNR。
- 相比之下,原始APRIL攻击在批量大小为2时即失效,Max-RPSNR降至8.422,凸显了先前方法的关键局限性。
- 该攻击在跨设备和跨存储库设置中均保持有效,表明其在真实联邦学习场景中的广泛适用性。
- 具有极端特征值的异常值数据点可显著减少查询次数(log(n))即可恢复,而中等特征值数据点则需n log(n)次查询,揭示了对隐私的非对称影响。
- 标准聚合防御机制(如均值或中值聚合)无法有效防止该攻击,因为恶意参数设计仍能主导梯度更新。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。