Skip to main content
QUICK REVIEW

[论文解读] Privacy-preserving Collaborative Learning with Automatic Transformation Search

Wei Gao, Shangwei Guo|arXiv (Cornell University)|Nov 25, 2020
Privacy-Preserving Technologies in Data参考文献 42被引用 4
一句话总结

本文提出了一种隐私保护型协作学习框架,通过自动搜索发现最优的数据增强策略,在模型训练前对训练图像进行变换,以防止从共享梯度中进行重建攻击。该方法在对模型准确率影响极小的情况下,有效防御了现有重建攻击,并利用新型度量指标加速策略搜索,实现了跨数据集的高可迁移性。

ABSTRACT

Collaborative learning has gained great popularity due to its benefit of data privacy protection: participants can jointly train a Deep Learning model without sharing their training sets. However, recent works discovered that an adversary can fully recover the sensitive training samples from the shared gradients. Such reconstruction attacks pose severe threats to collaborative learning. Hence, effective mitigation solutions are urgently desired. In this paper, we propose to leverage data augmentation to defeat reconstruction attacks: by preprocessing sensitive images with carefully-selected transformation policies, it becomes infeasible for the adversary to extract any useful information from the corresponding gradients. We design a novel search method to automatically discover qualified policies. We adopt two new metrics to quantify the impacts of transformations on data privacy and model usability, which can significantly accelerate the search speed. Comprehensive evaluations demonstrate that the policies discovered by our method can defeat existing reconstruction attacks in collaborative learning, with high efficiency and negligible impact on the model performance.

研究动机与目标

  • 为解决协作学习中一个关键威胁:攻击者可从共享梯度中恢复敏感的训练样本。
  • 开发一种实用的防御机制,在显著降低梯度中信息泄露的同时,保持模型的实用性。
  • 自动发现能够在隐私保护与模型性能之间实现平衡的最优数据增强策略。
  • 设计高效的搜索度量指标,以在无需完整模型训练的情况下加速策略发现。
  • 确保所发现的策略在不同数据集和协作学习系统中具备良好的可迁移性。

提出的方法

  • 提出一种新颖的搜索框架,可从大规模图像增强函数库中自动识别有效的变换策略。
  • 引入两种新度量指标——隐私得分和可用性得分,以在不训练完整模型的情况下量化变换对隐私泄露和模型性能的影响。
  • 采用基于这些度量指标的搜索算法,高效探索庞大的策略空间,并在不到 2.5 GPU 小时内识别出最优策略。
  • 将所选的变换策略应用于训练数据的预处理阶段,确保仅使用变换后的图像进行模型训练。
  • 设计轻量级、本地化的变换操作,不改变协作学习流程或训练效率。
  • 验证了所发现策略对多种变体的基于梯度的重建攻击的鲁棒性。

实验结果

研究问题

  • RQ1能否系统性地利用数据增强,在不降低模型性能的前提下防止协作学习中的重建攻击?
  • RQ2哪些度量指标能够有效预测变换策略在隐私与可用性之间的权衡,而无需完整训练模型?
  • RQ3如何高效探索变换策略的搜索空间,以识别出最优配置?
  • RQ4所发现的策略在不同数据集和模型架构之间的可迁移性如何?
  • RQ5所提出的方法能否防御从语义先验出发或采用其他优化策略的高级重建攻击?

主要发现

  • 所提方法发现的变换策略在 CIFAR100 和 F-MNIST 上成功抵御了现有重建攻击,即使在复杂攻击场景下仍能保持高保真度。
  • 最优策略相比基线方法将隐私得分降低了高达 70%,显著增加了基于梯度的重建难度。
  • 搜索过程在不到 2.5 GPU 小时内完成,尽管搜索空间庞大,仍表现出极高效率。
  • 所选变换(如水平偏移、亮度与对比度调整)会扭曲低层次图像特征(如纹理、颜色),同时保留语义内容,从而在不损害分类准确率的前提下保护隐私。
  • 所发现的策略表现出强大的可迁移性:在 CIFAR100 上优化的策略在 F-MNIST 上表现良好,仅需极少微调。
  • 该方法对训练效率和模型性能的影响可忽略不计,在 ResNet20 上测试准确率下降不足 1%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。