[论文解读] Differentially Private Coordinate Descent for Composite Empirical Risk Minimization
本文提出了差异隐私坐标下降(DP-CD)算法,这是一种针对复合经验风险最小化问题的新型差分隐私优化方法。通过利用坐标级梯度扰动和较大的常数步长,DP-CD 在不平衡问题中相比 DP-SGD 实现了更高的效用,并且在对数因子范围内匹配理论下界。
Machine learning models can leak information about the data used to train them. To mitigate this issue, Differentially Private (DP) variants of optimization algorithms like Stochastic Gradient Descent (DP-SGD) have been designed to trade-off utility for privacy in Empirical Risk Minimization (ERM) problems. In this paper, we propose Differentially Private proximal Coordinate Descent (DP-CD), a new method to solve composite DP-ERM problems. We derive utility guarantees through a novel theoretical analysis of inexact coordinate descent. Our results show that, thanks to larger step sizes, DP-CD can exploit imbalance in gradient coordinates to outperform DP-SGD. We also prove new lower bounds for composite DP-ERM under coordinate-wise regularity assumptions, that are nearly matched by DP-CD. For practical implementations, we propose to clip gradients using coordinate-wise thresholds that emerge from our theory, avoiding costly hyperparameter tuning. Experiments on real and synthetic data support our results, and show that DP-CD compares favorably with DP-SGD.
研究动机与目标
- 解决 DP-SGD 在步长约束和梯度不平衡敏感性方面的局限性,以改进差分隐私优化中的表现。
- 为具有非光滑正则化项(如 ℓ1)的复合 ERM 问题,设计一种新型差分隐私优化框架。
- 通过分析带有扰动梯度的非精确近端坐标下降,建立隐私-效用权衡的紧致理论界。
- 通过理论推导坐标级裁剪阈值,为超参数调优提供实用指导,避免昂贵的手动校准过程。
- 通过在真实和合成数据上的大量实验,证明 DP-CD 在平衡与不平衡设置下均优于 DP-SGD。
提出的方法
- 提出一种不同差分隐私近端坐标下降算法(DP-CD),通过使用扰动的局部梯度逐坐标更新一个坐标。
- 基于理论平滑常数进行坐标级梯度裁剪,以在保持隐私的同时减少噪声。
- 提出一种新的迭代点到最优解距离的递归分析方法,通过追踪坐标级正则性常数以获得更紧致的收敛界。
- 利用高级组合定理推导隐私保障,利用局部梯度相比完整梯度更低的敏感性。
- 通过子采样、差分隐私的程序私密估计坐标级平滑常数,从而在无需先验知识的情况下实现部署。
- 实现单超参数规则以自适应调整坐标级裁剪阈值,降低调参复杂度。
实验结果
研究问题
- RQ1在相同隐私预算下,坐标下降方法是否能在差分隐私 ERM 中实现优于 SGD 风格方法的效用?
- RQ2坐标级梯度大小的不平衡如何影响私有化优化算法的性能?
- RQ3在坐标级正则性假设下,复合 DP-ERM 的最优隐私-效用权衡是什么?
- RQ4能否使一种私有坐标下降算法在对数因子范围内匹配已知的 DP-ERM 理论下界?
- RQ5在实际应用中,如何高效设置坐标级裁剪阈值,而无需进行大量超参数调优?
主要发现
- 在不平衡数据集上,DP-CD 相较于 DP-SGD 显著降低了优化误差,例如在加州房价数据集上,ε=1 时相对误差减少高达 90%(0.0010 vs. 0.0087)。
- 在稀疏 LASSO 问题中,DP-CD 在 ε=10 时相比 DP-SGD 将误差降低超过 60%,相对误差分别为 0.2498 和 0.7551。
- DP-CD 每轮迭代的运行速度约为 DP-SGD 的 4–5 倍,从而能更快收敛至高效率解。
- 该算法在坐标级正则性假设下,对复合 DP-ERM 的理论下界匹配至对数因子范围内,表明其接近最优性。
- 所提出的单超参数规则可有效设置坐标级裁剪阈值,无需手动调优,且在多个数据集上均得到验证。
- 即使在平衡设置下,DP-CD 仍优于 DP-SGD,证实其适用范围不仅限于不平衡问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。