QUICK REVIEW
[论文解读] Quantification of the Leakage in Federated Learning
Zhaorui Li, Zhicong Huang|arXiv (Cornell University)|Oct 12, 2019
Privacy-Preserving Technologies in Data参考文献 12被引用 13
一句话总结
本文量化了联邦近似逻辑回归中的数据泄露问题,表明在同步设置下,一个诚实但好奇的参与者可通过梯度分析完全重建其他参与方的二值训练数据。在异步设置下,仅能推断出数据的部分约束,且随着批量大小和参与方数量的增加,泄露程度也相应提高。
ABSTRACT
With the growing emphasis on users' privacy, federated learning has become more and more popular. Many architectures have been raised for a better security. Most architecture work on the assumption that data's gradient could not leak information. However, some work, recently, has shown such gradients may lead to leakage of the training data. In this paper, we discuss the leakage based on a federated approximated logistic regression model and show that such gradient's leakage could leak the complete training data if all elements of the inputs are either 0 or 1.
研究动机与目标
- 分析在使用二值输入的近似逻辑回归时,联邦学习中数据泄露的程度。
- 研究在同态加密和近似方案下,联邦学习中的梯度是否可能泄露完整的训练数据。
- 量化在多个参与方参与下的同步与异步训练设置中的泄露程度。
- 评估超参数(如批量大小和参与方数量)对数据重建风险的影响。
- 提出针对联邦学习系统中基于梯度的数据泄露的实用防御措施。
提出的方法
- 使用基于 Aono 等人(2016)方法近似 Sigmoid 函数的联邦近似逻辑回归模型,以支持同态加密。
- 将训练过程建模为两方或多方设置,其中梯度通过安全聚合(Aono 等人,2017)进行聚合。
- 在同步模式下通过从聚合梯度中推导线性方程来分析梯度泄露,以重建输入数据矩阵。
- 应用线性规划求解二值输入数据,基于梯度与模型参数对之间的关系,利用稀疏性与二值约束。
- 在异步模式下,通过涉及梯度与模型更新乘积项的矩阵方程推导数据约束,表明解空间无限。
- 使用 PuLP 库在 Intel i5-8500 CPU 上对重建时间进行实验评估,变化批量大小与特征维度。
实验结果
研究问题
- RQ1在使用二值输入的联邦逻辑回归中,诚实但好奇的参与者能否完全重建其他参与方的训练数据?
- RQ2同步模式(同步 vs. 异步)如何影响通过梯度泄露的信息量?
- RQ3批量大小与参与方数量对数据重建的可行性与完整性有何影响?
- RQ4通过修改训练过程(如数据打乱或选择性梯度传输)能否减轻梯度泄露?
- RQ5在何种条件下系统可实现唯一的数据重建,而在何种条件下仅能获得部分约束?
主要发现
- 在同步设置下,只要梯度样本数量超过特征维度,诚实但好奇的参与者仅凭梯度与模型参数对即可完全重建其他参与方的训练数据。
- 通过从梯度表达式中推导出的线性方程组求解实现重建,利用输入的二值性将问题简化为整数规划。
- 随着批量大小增加,多个不同的数据批次可能产生相同的梯度,导致重建出现歧义,实验中已观察到多个匹配批次的出现。
- 在异步设置下,方程组具有无限多组解,意味着仅能推断出数据的约束(而非数据本身),显著降低了完全重建的风险。
- 随着特征维度和批量大小的增加,求解重建问题的时间迅速增长,当样本数为 11、特征数为 20 时,重建时间超过 1600 秒,表明对大规模数据而言计算上不可行。
- 通过数据打乱或选择性梯度传输等防御措施可模糊梯度,降低泄露风险,尤其在异步设置下效果更明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。