Skip to main content
QUICK REVIEW

[论文解读] Large Scale Transfer Learning for Differentially Private Image Classification

Harsh Mehta, Abhradeep Thakurta|arXiv (Cornell University)|May 6, 2022
Privacy-Preserving Technologies in Data被引用 5
一句话总结

该论文表明,大规模迁移学习显著提升了在 ImageNet 上的差分隐私图像分类性能。通过在大规模公开数据集(JFT-300M/4B)上预训练视觉变换器(vision transformers),仅使用 LAMB 优化器对最后一层进行单次完整批次的微调并采用近零初始化,即可在广泛的隐私预算范围内(ε ∈ [4,10],δ = 10⁻⁶)实现 81.7% 的最先进准确率,大幅降低计算成本的同时在强隐私保障下保持高模型效用。

ABSTRACT

Differential Privacy (DP) provides a formal framework for training machine learning models with individual example level privacy. In the field of deep learning, Differentially Private Stochastic Gradient Descent (DP-SGD) has emerged as a popular private training algorithm. Unfortunately, the computational cost of training large-scale models with DP-SGD is substantially higher than non-private training. This is further exacerbated by the fact that increasing the number of parameters leads to larger degradation in utility with DP. In this work, we zoom in on the ImageNet dataset and demonstrate that, similar to the non-private case, pre-training over-parameterized models on a large public dataset can lead to substantial gains when the model is finetuned privately. Moreover, by systematically comparing private and non-private models across a range of large batch sizes, we find that similar to non-private setting, choice of optimizer can further improve performance substantially with DP. By using LAMB optimizer with DP-SGD we saw improvement of up to 20$\%$ points (absolute). Finally, we show that finetuning just the last layer for a \emph{single step} in the full batch setting, combined with extremely small-scale (near-zero) initialization leads to both SOTA results of 81.7 $\%$ under a wide privacy budget range of $ε\in [4, 10]$ and $δ$ = $10^{-6}$ while minimizing the computational overhead substantially.

研究动机与目标

  • 利用迁移学习提升大规模私有图像分类中的隐私-效用权衡。
  • 解决在大模型上进行差分隐私训练时计算成本高和性能下降的问题。
  • 研究模型规模、预训练数据规模、优化器选择以及学习率和权重初始化等超参数对 DP 性能的影响。
  • 在强隐私约束(ε ∈ [4,10],δ = 10⁻⁶)下最小化计算开销,同时最大化模型准确率。

提出的方法

  • 在无隐私约束的大规模公开数据集(JFT-300M 和 JFT-4B)上预训练视觉变换器(ViT-H/14-4b)。
  • 使用差分隐私随机梯度下降(DP-SGD)在 ImageNet 上对预训练模型进行微调,采用完整批次、单步更新。
  • 在私有微调过程中使用 LAMB 优化器,以提升大批次下的收敛性和性能。
  • 对最终分类层采用近零或极小的初始化权重,以增强隐私-效用权衡。
  • 优化超参数,包括输入分辨率(256×256)、裁剪策略(中心裁剪)以及学习率缩放。
  • 通过噪声倍乘器 σ 控制隐私预算,并使用标准 DP-SGD 机制确保 (ε, δ)-差分隐私。

实验结果

研究问题

  • RQ1在公开数据集上进行大规模预训练是否能提升 ImageNet 上差分隐私图像分类器的准确率?
  • RQ2在 DP-SGD 与大批次设置下,优化器选择(如 LAMB 与带动量的 SGD)如何影响性能?
  • RQ3在私有微调中,最后一层权重初始化的大小对最终准确率有何影响?
  • RQ4单次完整批次微调过程是否能实现最先进结果并最小化计算成本?
  • RQ5在差分隐私下使用大批次训练时,输入分辨率如何影响模型性能?

主要发现

  • 使用在 JFT-4B 上预训练的 ViT-H/14-4b 模型,并对最后一层进行单次完整批次微调,可在 ε ∈ [4,10],δ = 10⁻⁶ 条件下于 ImageNet 上实现 81.7% 的 top-1 准确率。
  • 与使用动量的 SGD 相比,LAMB 优化器在相同隐私预算(ε=10,δ=10⁻⁶)下将准确率提升了最高达 20 个百分点(绝对值)。
  • 采用近零权重初始化最后一层显著提升了性能;较大的初始化权重则导致准确率下降,尤其在差分隐私设置下更为明显。
  • 256×256 的输入分辨率在大批次训练中表现最佳,表明分辨率与 DP 效用之间存在非平凡关系。
  • 仅训练一个周期(等效于一次完整批次更新)的性能优于更长的训练周期,可能由于噪声累积减少及更优的隐私会计机制。
  • 大规模预训练、LAMB 优化与最小化微调的结合,实现了超越先前工作的最先进结果,包括 Kurakin 等人(2022)和 De 等人(2022)的工作,在所有测试的 ε 值下均表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。