Skip to main content
QUICK REVIEW

[论文解读] Differentially Private Bias-Term Fine-tuning of Foundation Models

Zhiqi Bu, Yu-Xiang Wang|arXiv (Cornell University)|Sep 30, 2022
Privacy-Preserving Technologies in Data被引用 7
一句话总结

本文提出 DP-BiTFiT,一种差分隐私保护、与模型无关的微调方法,仅训练基础模型的偏置项,在实现最先进准确率的同时,参数效率高达 0.1%,计算开销接近零。其速度比 DP 全参数微调快 2–30 倍,内存占用减少 2–8 倍,可在长序列和高分辨率图像上实现高效私有化训练。

ABSTRACT

We study the problem of differentially private (DP) fine-tuning of large pre-trained models -- a recent privacy-preserving approach suitable for solving downstream tasks with sensitive data. Existing work has demonstrated that high accuracy is possible under strong privacy constraint, yet requires significant computational overhead or modifications to the network architecture. We propose differentially private bias-term fine-tuning (DP-BiTFiT), which matches the state-of-the-art accuracy for DP algorithms and the efficiency of the standard BiTFiT. DP-BiTFiT is model agnostic (not modifying the network architecture), parameter efficient (only training about 0.1% of the parameters), and computation efficient (almost removing the overhead caused by DP, in both the time and space complexity). On a wide range of tasks, DP-BiTFiT is 2~30X faster and uses 2~8X less memory than DP full fine-tuning, even faster than the standard full fine-tuning. This amazing efficiency enables us to conduct DP fine-tuning on language and vision tasks with long-sequence texts and high-resolution images, which were computationally difficult using existing methods. We open-source our code at FastDP (https://github.com/awslabs/fast-differential-privacy).

研究动机与目标

  • 解决在敏感数据上对大型基础模型进行隐私保护微调的挑战,同时最小化计算和内存开销。
  • 克服现有差分隐私(DP)微调方法存在的高计算成本或架构修改问题。
  • 实现在长序列自然语言处理和高分辨率图像分类等计算密集型任务上的高效 DP 微调。
  • 在强隐私约束(如 ε ≤ 8)下保持高模型准确率,同时确保参数和计算效率。

提出的方法

  • 提出一种与模型无关的方法,仅对预训练模型的偏置项进行微调,其余所有权重保持冻结。
  • 在仅微调偏置项的过程中集成差分隐私(DP),采用 DP-SGD 方法,结合梯度裁剪和噪声注入。
  • 消除前向激活缓存和权重梯度反向传播,显著降低内存和时间复杂度。
  • 通过避免对冻结权重的计算,仅追踪偏置参数的梯度,实现接近零的 DP 开销。
  • 引入两阶段训练策略:先进行 X 个周期(X ≤ 2)的 DP 全参数微调,随后切换至 DP-BiTFiT 以在保持高准确率的同时提升效率。
  • 通过联合优化偏置项与其他参数,将 DP-BiTFiT 与其它参数高效方法(如 LoRA、Adapter)结合。

实验结果

研究问题

  • RQ1仅微调偏置项是否能在不修改模型架构的前提下,在强差分隐私约束下实现具有竞争力的准确率?
  • RQ2在多种自然语言处理和视觉任务中,DP-BiTFiT 与 DP 全参数微调在准确率、速度和内存使用方面相比如何?
  • RQ3在全参数微调计算上不可行的长序列和高分辨率输入任务中,DP-BiTFiT 是否仍能保持效率和准确率?
  • RQ4结合全参数微调与偏置项微调的两阶段训练策略,是否能提升在小样本或困难模型上的性能,尤其当 DP-BiTFiT 表现不佳时?

主要发现

  • 在强隐私约束(ε ≤ 8)下,DP-BiTFiT 在 GLUE 和 MNLI 基准测试中达到最先进准确率,与或超过以往 DP 方法。
  • 在 CIFAR100 上,ε=2 时,DP-BiTFiT 使用 BEiT-large 模型达到 88.7% 准确率,优于相同隐私预算下以往最先进全参数微调方法(87.0%)。
  • DP-BiTFiT 比 DP 全参数微调快 2–30 倍,内存占用减少 2–8 倍,甚至在速度上超过标准非私有全参数微调。
  • 在视觉任务中,DP-BiTFiT 在 ImageNet 上使用 ViT-Large 达到 95.5% 准确率(ε=8),而全参数微调为 98.0%,表明其在高分辨率图像上表现强劲。
  • 在 CIFAR10 上,两阶段训练(1+BiTFiT)将准确率提升至 98.8%(ε=2),比以往最先进全参数微调高出 1.7 个百分点。
  • DP-BiTFiT 在包括 GPT2、RoBERTa 和 ViT 在内的各类模型中,均保持一致的参数效率(约 0.1%),无论模型大小如何。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。