[论文解读] Large Scale Private Learning via Low-rank Reparametrization
本文提出重参数化梯度扰动(RGP),一种低秩重参数化方法,通过降低内存使用并打破噪声的维度依赖性,使在 BERT 等大模型上实现差分隐私随机梯度下降成为可能。RGP 在四个 NLP 任务上实现了 83.9% 的平均准确率(ε=8),与非私有基线模型相比差距在 5% 以内,同时有效防止了成员推断攻击。
We propose a reparametrization scheme to address the challenges of applying differentially private SGD on large neural networks, which are 1) the huge memory cost of storing individual gradients, 2) the added noise suffering notorious dimensional dependence. Specifically, we reparametrize each weight matrix with two \emph{gradient-carrier} matrices of small dimension and a \emph{residual weight} matrix. We argue that such reparametrization keeps the forward/backward process unchanged while enabling us to compute the projected gradient without computing the gradient itself. To learn with differential privacy, we design \emph{reparametrized gradient perturbation (RGP)} that perturbs the gradients on gradient-carrier matrices and reconstructs an update for the original weight from the noisy gradients. Importantly, we use historical updates to find the gradient-carrier matrices, whose optimality is rigorously justified under linear regression and empirically verified with deep learning tasks. RGP significantly reduces the memory cost and improves the utility. For example, we are the first able to apply differential privacy on the BERT model and achieve an average accuracy of $83.9\%$ on four downstream tasks with $ε=8$, which is within $5\%$ loss compared to the non-private baseline but enjoys much lower privacy leakage risk.
研究动机与目标
- 解决在大型深度神经网络上使用差分隐私随机梯度下降时的高内存开销与低效用问题。
- 克服梯度扰动中噪声的维度依赖性,该问题随模型规模增大而降低模型效用。
- 实现对 BERT 等大规模模型的隐私保护训练,此前由于内存与噪声限制而不可行。
- 设计一种重参数化方案,在保持模型行为不变的同时,实现高效且私有的梯度计算与更新。
- 证明历史更新可用于近似差分隐私下的最优梯度载体,确保模型效用与隐私性。
提出的方法
- 将每个权重矩阵 𝐖 重参数化为 𝐖 = 𝐋𝐑 + 𝐖̃,其中 𝐋 和 𝐑 为低秩梯度载体,𝐖̃ 为残差权重,保持前向/反向传播不变。
- 利用 𝐋 和 𝐑 上的梯度,计算原始 𝐖 梯度的投影,而无需显式计算 𝐖 的梯度,从而节省内存。
- 仅在低维的 𝐋 和 𝐑 矩阵上应用梯度裁剪与噪声注入,降低总噪声强度。
- 从 𝐋 和 𝐑 上的噪声梯度构造最终的权重更新,确保隐私性的同时保持模型性能。
- 利用已发布的模型历史更新计算 𝐋 和 𝐑 的主奇异向量,利用后处理隐私保证。
- 在线性回归下理论证明该方法的最优性,并在深度学习设置中通过实证验证。
实验结果
研究问题
- RQ1低秩重参数化能否降低差分隐私 SGD 中存储单个梯度的内存开销?
- RQ2在低秩载体上扰动梯度而非完整权重矩阵,能否降低大模型中的噪声强度并提升效用?
- RQ3能否利用历史模型更新在不违反差分隐私的前提下近似最优梯度载体?
- RQ4在 DP 约束下,RGP 在训练 BERT 等大模型时,能在多大程度上保持模型效用?
- RQ5RGP 是否能有效防止对私有模型的成员推断攻击?
主要发现
- RGP 实现了差分隐私在 BERT 模型上的首次成功应用,在四个下游 NLP 任务上平均准确率达到 83.9%(ε=8)。
- RGP 训练的 BERT 模型上,成员推断攻击的成功率约为 50%,表明无显著隐私泄露;而非私有模型的攻击成功率则为 55–60%。
- 仅使用低秩重参数化的模型,其成员推断成功率已低于标准模型,表明其具有内在的隐私优势。
- 实证发现深层网络中每一层的梯度具有低稳定秩,验证了 RGP 所依赖的低秩假设。
- 利用历史更新近似主梯度子空间的方法,在线性回归中具有理论依据,在深度学习中也具有实证有效性。
- 与标准 DP-SGD 相比,RGP 显著降低了总噪声强度,打破了私有学习中著名的效用维度依赖性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。