Skip to main content
QUICK REVIEW

[论文解读] Private Stochastic Convex Optimization: Optimal Rates in $\ell_1$ Geometry

Hilal Asi, Vitaly Feldman|arXiv (Cornell University)|Mar 2, 2021
Privacy-Preserving Technologies in Data参考文献 26被引用 5
一句话总结

该论文为在 $\sigma_1$-有界域上的差分隐私随机凸优化确定了最优的过剩种群损失率,提出了一种基于私有正则化镜像下降的新型迭代定位算法,实现了 $\widetilde{O}(\sqrt{\log d/n} + \sqrt{d}/(\varepsilon n))$ 的误差。对于光滑函数,该文设计了一种方差缩减的 Frank-Wolfe 算法,其梯度查询次数为 $O(n)$,误差为 $\widetilde{O}(\sqrt{\log d/n} + (\log d/((\varepsilon n))^{2/3})$,表明当 $d \gg n$ 且 $\varepsilon \geq n^{-1/4}$ 时,该设置下隐私成本几乎可忽略。该成果填补了长期存在的关于 $\ell_1$ 几何下私有优化的理解空白。

ABSTRACT

Stochastic convex optimization over an $\ell_1$-bounded domain is ubiquitous in machine learning applications such as LASSO but remains poorly understood when learning with differential privacy. We show that, up to logarithmic factors the optimal excess population loss of any $(\varepsilon,δ)$-differentially private optimizer is $\sqrt{\log(d)/n} + \sqrt{d}/\varepsilon n.$ The upper bound is based on a new algorithm that combines the iterative localization approach of~\citet{FeldmanKoTa20} with a new analysis of private regularized mirror descent. It applies to $\ell_p$ bounded domains for $p\in [1,2]$ and queries at most $n^{3/2}$ gradients improving over the best previously known algorithm for the $\ell_2$ case which needs $n^2$ gradients. Further, we show that when the loss functions satisfy additional smoothness assumptions, the excess loss is upper bounded (up to logarithmic factors) by $\sqrt{\log(d)/n} + (\log(d)/\varepsilon n)^{2/3}.$ This bound is achieved by a new variance-reduced version of the Frank-Wolfe algorithm that requires just a single pass over the data. We also show that the lower bound in this case is the minimum of the two rates mentioned above.

研究动机与目标

  • 为差分隐私随机凸优化(DP-SCO)在 $\ell_1$-有界域上的理解空白提供补足,此前的研究仅达到了次优率。
  • 设计能够实现 $\ell_1$-几何下最优过剩种群损失的私有算法,尤其针对非光滑与光滑凸函数。
  • 通过将非光滑函数的梯度查询次数从 $O(n^2)$ 降低至 $O(n^{3/2})$,以及将光滑函数的梯度查询次数降低至 $O(n)$,提升计算效率。
  • 建立与上界匹配的紧致下界,证明所提算法的最优性。

提出的方法

  • 提出一种新型迭代定位算法,结合带噪声的正则化镜像下降,并采用专为 $\ell_1$-几何设计的新颖分析方法。
  • 引入一种方差缩减的私有 Frank-Wolfe 算法,实现线性 $O(n)$ 时间复杂度,并在光滑性条件下达到最优率。
  • 将迭代定位框架应用于 $p \in [1,2]$ 的 $\ell_p$-有界域,将结果推广至 $\ell_1$ 之外的范围。
  • 利用后处理论证,将过剩经验损失的下界转换为过剩种群损失的下界。
  • 采用一种自举技术,从 $\ell_1$ 空间中的均值估计问题推导出种群损失的下界。
  • 通过集中与敏感性边界分析,研究隐私参数 ($\varepsilon, \delta$)、维度 $d$ 与样本量 $n$ 之间的权衡。

实验结果

研究问题

  • RQ1在 $\ell_1$-有界域上,差分隐私随机凸优化的最优过剩种群损失率是多少?
  • RQ2当损失函数为光滑函数时,私有优化能否实现与非私有最优率相匹配的速率,特别是在 $\ell_1$ 几何下?
  • RQ3能否设计出在 $\ell_1$-几何下对光滑函数仅需 $O(n)$ 梯度查询的私有算法,从而优于以往的 $O(n^2)$ 方法?
  • RQ4在差分隐私下,$\ell_1$ 几何中过剩种群损失的最紧致下界是什么?
  • RQ5约束集的几何结构(如 $\ell_1$ 与 $\ell_2$)如何影响隐私、准确率与计算成本之间的权衡?

主要发现

  • 在 $\ell_1$-有界域上,非光滑函数的最优过剩种群损失为 $\widetilde{O}(\sqrt{\log d/n} + \sqrt{d}/(\varepsilon n))$,与下界仅相差对数因子。
  • 对于光滑函数,最优过剩损失为 $\widetilde{O}(\sqrt{\log d/n} + (\log d/(\varepsilon n))^{2/3})$,由一种新型方差缩减的 Frank-Wolfe 算法实现。
  • 所提出的 Frank-Wolfe 算法具有线性时间复杂度($O(n)$),且仅需 $O(n)$ 梯度查询,显著优于以往的 $O(n^2)$ 方法。
  • 下界与上界匹配:非光滑函数的下界为 $\Omega(\sqrt{d}/(n\varepsilon))$,光滑函数的下界为 $\Omega((\log d/(n\varepsilon))^{2/3})$,证明了算法的最优性。
  • 结果可推广至 $p \in [1,2]$ 的 $\ell_p$-有界域,表明 $\ell_1$ 几何可实现优于以往已知的速率。
  • 在高维情形下,当 $d \gg n$ 且 $\varepsilon \geq n^{-1/4}$ 时,隐私对过剩损失的影响可忽略不计,使得私有优化几乎与非私有优化一样高效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。