Skip to main content
QUICK REVIEW

[论文解读] Differentially private training of residual networks with scale normalisation

Helena Klause, Alexander Ziller|arXiv (Cornell University)|Mar 1, 2022
Privacy-Preserving Technologies in Data被引用 13
一句话总结

本文提出 ScaleNorm,一种简单的架构改进方法,在残差网络的残差块加法操作后添加归一化层,缓解了‘尺度混叠’现象——即残差路径与卷积路径的激活值尺度不匹配的问题。通过结合 DP-SGD 和近期的训练优化方法,作者在 ε=8.0 时于 CIFAR-10 上实现了 82.5% 的新 SOTA(最先进)top-1 准确率,且从零开始训练。

ABSTRACT

The training of neural networks with Differentially Private Stochastic Gradient Descent offers formal Differential Privacy guarantees but introduces accuracy trade-offs. In this work, we propose to alleviate these trade-offs in residual networks with Group Normalisation through a simple architectural modification termed ScaleNorm by which an additional normalisation layer is introduced after the residual block's addition operation. Our method allows us to further improve on the recently reported state-of-the art on CIFAR-10, achieving a top-1 accuracy of 82.5% (ε=8.0) when trained from scratch.

研究动机与目标

  • 解决深度神经网络差分隐私训练中的隐私-效用权衡问题,特别是在需要高准确率和强隐私保护的医疗与视觉应用中。
  • 研究并解决在 DP-SGD 训练过程中残差网络中出现的‘尺度混叠’问题,即残差路径激活未归一化,而特征路径激活已归一化。
  • 通过引入最小的架构修改,提升使用 DP-SGD 从零开始训练的残差网络的收敛速度与测试准确率。
  • 证明 ScaleNorm 与现有训练优化方法结合,可在差分隐私约束下于图像基准测试中实现最先进性能。

提出的方法

  • 提出 ScaleNorm:在残差块中残差连接的加法操作后插入一个额外的归一化层。
  • 对残差路径应用组归一化(Group Normalization),以维持差分隐私保证,替代与 DP-SGD 不兼容的批量归一化(Batch Normalization)。
  • 将 ScaleNorm 集成到标准的 ResNet 和 WideResNet 架构中,修改前向传播过程,对残差路径与特征路径之和进行归一化。
  • 使用差分隐私随机梯度下降(DP-SGD)进行模型训练,并通过 Rényi DP 会计方法(Opacus)进行隐私预算追踪。
  • 应用 De 等人(2022)提出的近期训练优化方法,包括增强多样性与权重平均,以进一步提升性能。
  • 使用 Optuna 进行超参数搜索,采用树形结构帕尔兹估计器(Tree-structured Parzen Estimator)与阈值剪枝策略,并在每次运行后重置隐私预算。

实验结果

研究问题

  • RQ1在 DP-SGD 训练下,残差网络中的尺度混叠现象如何影响训练收敛性与测试准确率?
  • RQ2像 ScaleNorm 这类简单的架构修改是否能有效缓解尺度混叠问题,并提升差分隐私训练下的模型性能?
  • RQ3当与高级训练技术结合时,ScaleNorm 在 DP-SGD 中能将准确率提升多少?
  • RQ4ScaleNorm 是否在不同架构与数据集(包括 CIFAR-10、ImageNette 和 Tiny ImageNet)上具有泛化能力?
  • RQ5在应用高计算量训练优化方法时,ScaleNorm 所带来的准确率提升与训练效率之间的权衡如何?

主要发现

  • 在 ε=8.0 时,ScaleNorm 在 CIFAR-10 上实现了 82.5% 的 top-1 准确率,且从零开始训练,创下新 SOTA 记录。
  • 在 CIFAR-10 上,与标准 WRN-16/4(81.25% vs. 82.5%)相比,ScaleNorm 在相同隐私预算下将准确率提升了 1.25 个百分点。
  • 在 ImageNette 上,ScaleNorm 在 ε=9.88 时将 top-1 准确率提升了 1.3 个百分点(67.1% vs. 65.0%)。
  • 在 Tiny ImageNet 上,ScaleNorm 在 ε=70 时达到 25.8% 的 top-1 准确率,较基线提升 1.1 个百分点。
  • 在所有测试的隐私水平下,性能提升均保持一致,且在更高隐私预算下观察到最大的相对增益。
  • 使用 ScaleNorm 与完整训练优化方法后,训练时间增加至约 16 小时(双 GPU),但相比基线模型,准确率提升了约 10%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。