[论文解读] Scalable and Efficient Training of Large Convolutional Neural Networks with Differential Privacy
本论文提出了一种新颖且高效的逐样本梯度裁剪方法——混合幽灵裁剪(mixed ghost clipping),用于大规模卷积神经网络(CNNs)和视觉变换器(ViTs)的差分隐私(DP)训练。通过避免显式计算逐样本梯度,该方法显著降低了内存和计算开销,使DP训练速度最高提升3倍,且内存成本仅比非私有训练高出1–10%,在CIFAR-10(ε=1时准确率达96.7%)和CIFAR-100(ε=1时准确率达83.0%)上实现了当前最优的性能表现。
Large convolutional neural networks (CNN) can be difficult to train in the differentially private (DP) regime, since the optimization algorithms require a computationally expensive operation, known as the per-sample gradient clipping. We propose an efficient and scalable implementation of this clipping on convolutional layers, termed as the mixed ghost clipping, that significantly eases the private training in terms of both time and space complexities, without affecting the accuracy. The improvement in efficiency is rigorously studied through the first complexity analysis for the mixed ghost clipping and existing DP training algorithms. Extensive experiments on vision classification tasks, with large ResNet, VGG, and Vision Transformers, demonstrate that DP training with mixed ghost clipping adds $1\sim 10\%$ memory overhead and $<2 imes$ slowdown to the standard non-private training. Specifically, when training VGG19 on CIFAR10, the mixed ghost clipping is $3 imes$ faster than state-of-the-art Opacus library with $18 imes$ larger maximum batch size. To emphasize the significance of efficient DP training on convolutional layers, we achieve 96.7\% accuracy on CIFAR10 and 83.0\% on CIFAR100 at $ε=1$ using BEiT, while the previous best results are 94.8\% and 67.4\%, respectively. We open-source a privacy engine (\url{https://github.com/woodyx218/private_vision}) that implements DP training of CNN with a few lines of code.
研究动机与目标
- 解决大规模CNN差分隐私(DP)训练中逐样本梯度裁剪带来的高计算与内存开销问题。
- 克服DP训练中的可扩展性瓶颈,特别是在需要大批次以实现高模型准确率时。
- 在强隐私保障下实现对大型视觉模型(包括ResNet、VGG和视觉变换器ViTs)的高效训练。
- 证明当采用高效裁剪方法时,大DP模型并不必然导致性能劣于小模型,从而挑战了先前的经验观察。
- 提供一个实用的开源隐私引擎,简化视觉模型中DP训练的部署。
提出的方法
- 提出混合幽灵裁剪技术,通过结合幽灵梯度与逐层裁剪决策,避免显式计算逐样本梯度。
- 引入一种逐层决策机制,根据空间尺寸(H×W)在标准裁剪与幽灵裁剪之间进行选择,以最小化内存开销。
- 实现该方法以兼容任意DP优化器与任意裁剪函数,同时保持接近非私有训练的内存效率。
- 设计一种计算图,用于在不存储中间逐样本梯度的情况下计算梯度范数与裁剪后的梯度,从而减少内存占用。
- 采用混合策略,仅对选定的特征图应用幽灵梯度技术,在准确率与效率之间实现平衡。
- 将该方法集成至一个隐私引擎中(开源地址:https://github.com/woodyx218/private_vision),实现CNN与ViTs的即插即用式DP训练。
实验结果
研究问题
- RQ1能否在不牺牲模型准确率的前提下,显著提升大规模CNN DP训练中逐样本梯度裁剪的内存与时间效率?
- RQ2混合幽灵裁剪的效率是否足以支持在强隐私保障(如ε=1)下对更大模型(如VGG与视觉变换器)进行训练,并实现更高的准确率?
- RQ3与Opacus或幽灵裁剪等现有方法相比,混合幽灵裁剪在理论与实证复杂度上的权衡关系如何?
- RQ4大DP视觉模型是否能在CIFAR-10与CIFAR-100等标准基准上实现SOTA性能,尤其是在强隐私约束下?
- RQ5混合幽灵裁剪带来的内存效率提升在多大程度上支持更大的批量大小?这对训练速度与收敛性有何影响?
主要发现
- 混合幽灵裁剪将内存开销控制在10%以内,训练延迟低于非私有训练的2倍,即使在BEiT(3.03亿参数)等大模型上也成立。
- 在CIFAR-10上的VGG19模型中,混合幽灵裁剪比Opacus快3倍,并支持最大批量大小提升18倍。
- 在ε=1时,该方法在CIFAR-10上达到96.7%的测试准确率,在CIFAR-100上达到83.0%,分别优于此前SOTA结果(94.8%与67.4%)。
- 该方法使ViTs(如CrossViT与BEiT)在仅增加0.3%内存开销、训练速度仅为非私有训练2倍的情况下实现规模化训练。
- 复杂度分析表明,混合幽灵裁剪通过采用有原则的逐层裁剪策略,避免了现有方法的高内存负担。
- 在相同批量大小下,混合幽灵裁剪比次优DP算法快1.7倍;在内存节省支持下使用更大批量时,最高可实现3倍速度提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。