[论文解读] Private Adaptive Gradient Methods for Convex Optimization
本文提出了 Pagan,一种差分隐私自适应优化算法,通过使用非各向同性噪声和基于梯度几何的裁剪,改进了标准的私有化随机梯度下降(DP-SGD)。该方法通过根据实际梯度大小而非使用均匀(高斯)噪声来调整噪声,实现了更紧致的遗憾边界和更优的实验性能,尤其在非各向同性、高维设置下表现突出。
We study adaptive methods for differentially private convex optimization, proposing and analyzing differentially private variants of a Stochastic Gradient Descent (SGD) algorithm with adaptive stepsizes, as well as the AdaGrad algorithm. We provide upper bounds on the regret of both algorithms and show that the bounds are (worst-case) optimal. As a consequence of our development, we show that our private versions of AdaGrad outperform adaptive SGD, which in turn outperforms traditional SGD in scenarios with non-isotropic gradients where (non-private) Adagrad provably outperforms SGD. The major challenge is that the isotropic noise typically added for privacy dominates the signal in gradient geometry for high-dimensional problems; approaches to this that effectively optimize over lower-dimensional subspaces simply ignore the actual problems that varying gradient geometries introduce. In contrast, we study non-isotropic clipping and noise addition, developing a principled theoretical approach; the consequent procedures also enjoy significantly stronger empirical performance than prior approaches.
研究动机与目标
- 解决标准差分隐私随机梯度下降在高维、非各向同性问题中因梯度几何重要性而表现次优的问题。
- 克服私有化优化中各向同性噪声的局限性,该噪声会主导信号并忽略梯度结构。
- 提出一种基于实际梯度大小和几何结构的系统性私有自适应方法,以改善收敛速率。
- 证明在合理的分布假设下,私有自适应方法可优于非自适应方法。
- 提供理论遗憾边界和下界,以证明所提方法的紧致性和最优性。
提出的方法
- 提出 Pagan,一种基于 AdaGrad 的差分隐私变体,采用非各向同性噪声和基于观测梯度范数的自适应裁剪。
- 引入一种私有自适应机制,根据梯度的实际大小缩放噪声,避免最坏情况假设。
- 使用矩会计分析(Abadi 等人)来追踪自适应噪声和裁剪下的隐私损失。
- 应用对角 Hessian 近似高效估计梯度二阶矩,实现实时自适应,而无需计算完整协方差矩阵。
- 设计一种私有优化框架,在保持隐私的同时利用梯度中的几何结构,避免低秩子空间假设。
- 在 WikiText-103 数据集上的 LSTM 语言模型上实现并评估 Pagan,与 DP-SGD 和非私有基线进行比较。
实验结果
研究问题
- RQ1能否在保持非各向同性设置下自适应优化方法的几何优势的同时,使其具备差分隐私性?
- RQ2在高维问题中,私有自适应方法中添加非各向同性噪声是否能带来优于各向同性噪声的收敛性能?
- RQ3在泛化能力和隐私-准确率权衡方面,私有自适应方法与标准 DP-SGD 相比如何?
- RQ4能否在自然分布假设下推导出私有自适应方法的理论遗憾边界,并证明其紧致性?
- RQ5Pagan 在真实世界 NLP 任务中相对于其他私有和非私有优化方法的实验性能如何?
主要发现
- 在所有隐私级别(ε = 0.5, 1, 3)下,Pagan 的测试困惑度显著优于 DP-SGD 和 Pasan,在 ε = 0.5 时达到 291.41 的测试困惑度,而 DP-SGD 为 350.23。
- 在 ε = 3 时,Pagan 将测试困惑度降低至 224.82,优于 Pasan(238.87)和 DP-SGD(238.44),在私有设置中表现出一致的优越性。
- Pagan 的遗憾边界在最坏情况下是最优的,并准确反映了实际梯度几何,而标准私有 SGD 依赖于最坏情况的梯度大小。
- 在非各向同性梯度场景下,Pagan 在自适应和非自适应私有 SGD 中均表现更优,这与非私有 AdaGrad 在此类场景中优于 SGD 的已知结论一致。
- 该方法对超参数误设具有鲁棒性,因为当矩估计存在乘法误差时,收敛保证仅以常数因子退化。
- Pagan 避免了低秩子空间投影带来的内存和计算负担(与 PDP-SGD 不同),使其在不损失性能的前提下可扩展至大规模模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。