Skip to main content
QUICK REVIEW

[论文解读] Differentially Private Optimization on Large Model at Small Cost

Zhiqi Bu, Yuxiang Wang|arXiv (Cornell University)|Sep 30, 2022
Stochastic Gradient Optimization Techniques被引用 5
一句话总结

本文提出Book-Keeping(BK)——一种新颖的系统级技术,可显著降低大规模深度学习模型中差分隐私(DP)优化的计算与内存开销。通过结合幽灵范数(ghost norm)、记账机制(book-keeping)与幽灵反向传播(ghost differentiation),BK在保持GPT2、ResNet与ViT在视觉与语言任务上最先进DP准确率的同时,将训练效率提升至接近标准训练水平——仅需1.03倍时间,内存开销低于1%。

ABSTRACT

Differentially private (DP) optimization is the standard paradigm to learn large neural networks that are accurate and privacy-preserving. The computational cost for DP deep learning, however, is notoriously heavy due to the per-sample gradient clipping. Existing DP implementations are 2-1000X more costly in time and space complexity than the standard (non-private) training. In this work, we develop a novel Book-Keeping (BK) technique that implements existing DP optimizers (thus achieving the same accuracy), with a substantial improvement on the computational cost. Specifically, BK enables DP training on large models and high dimensional data to be roughly as fast and memory-saving as the standard training, whereas previous DP algorithms can be inefficient or incapable of training due to memory error. The computational advantage of BK is supported by the complexity analysis as well as extensive experiments on vision and language tasks. Our implementation achieves state-of-the-art (SOTA) accuracy with very small extra cost: on GPT2 and at almost the same memory cost (<1% overhead), BK has 1.03X the time complexity of the standard training (0.83X training speed in practice), and 0.61X the time complexity of the most efficient DP implementation (1.36X training speed in practice). We open-source the codebase for the BK algorithm at the FastDP library (https://github.com/awslabs/fast-differential-privacy).

研究动机与目标

  • 解决差分隐私深度学习中高计算与内存开销的问题,尤其针对大模型与高维数据。
  • 突破DP优化器中逐样本梯度裁剪的瓶颈,该瓶颈传统上导致2–1000倍的性能下降与显著的内存膨胀。
  • 设计一种系统级优化方法,使DP训练效率接近标准非私有训练,同时不牺牲隐私保证。
  • 将该方法扩展至支持参数高效微调(如LoRA、Adapter)与分布式训练,确保广泛兼容性。
  • 在视觉与语言基准上实现最先进隐私-准确率权衡,且性能开销极低。

提出的方法

  • 提出Book-Keeping(BK)技术,通过追踪并重用小批量中各样本间的中间梯度值,高效计算逐样本梯度范数。
  • 利用幽灵范数技巧避免显式存储逐样本梯度,降低内存使用,并实现高效的梯度范数计算。
  • 应用幽灵反向传播技术,在反向传播过程中无需存储完整逐样本梯度,从而最小化内存占用。
  • 设计混合BK算法,根据模型架构与特征维度动态切换幽灵范数与逐样本梯度实例化,以优化性能。
  • 将BK集成至模块化、自动化的代码库(FastDP)中,支持任意PyTorch模型、优化器与训练设置(包括LoRA、BiTFit、ZeRO与梯度累积)。
  • 通过理论复杂度分析与实证评估验证,BK在理论上实现接近理想的时空复杂度,在实践中也趋近标准训练表现。

实验结果

研究问题

  • RQ1能否使DP优化中的逐样本梯度裁剪在时间和内存复杂度上与标准训练相当?
  • RQ2像幽灵范数与记账机制这样的系统级优化,如何减轻大模型DP训练的计算负担?
  • RQ3在不同模型架构与输入维度下,幽灵范数与逐样本梯度实例化之间的最优权衡是什么?
  • RQ4BK技术能否泛化以支持参数高效微调与分布式训练,同时不牺牲隐私或效率?
  • RQ5BK在多大程度上弥合了DP训练中理论复杂度与实际硬件性能之间的差距?

主要发现

  • 在GPT2上,BK将DP训练的时间复杂度降低至标准训练的1.03倍,实际训练速度达到标准训练的0.83倍,内存开销低于1%。
  • 在RoBERTa-large上,BK实现比最高效现有DP实现(GhostClip)快1.36倍,时间复杂度仅为0.61倍。
  • BK使BEiT-large与GPT2-large等大模型可在单张A100 GPU上训练而不会发生内存溢出,而先前方法因内存限制而失败。
  • 混合BK算法能自适应地在幽灵范数与逐样本梯度计算之间切换,实现跨架构的最优性能——在Transformer中偏好幽灵范数,在更深的CNN中则偏好逐样本梯度。
  • BK在视觉与语言任务上保持最先进准确率:在E2E数据集上BLEU得分为64.6(ε=3),在CIFAR10上准确率达97.1%(ε=2)。
  • 基于BK构建的FastDP库支持与任意模型、优化器与训练技术(如LoRA、ZeRO)的自动集成,确保广泛兼容性与未来可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。