Skip to main content
QUICK REVIEW

[論文レビュー] Fast Dimension Independent Private AdaGrad on Publicly Estimated Subspaces

Peter Kairouz, Mónica Ribero|arXiv (Cornell University)|Aug 14, 2020
Privacy-Preserving Technologies in Data参考文献 45被引用数 9
ひとこと要約

本稿は、公開で推定された勾配部分空間と勾配ノルムの既知のエンvelope を活用することで、次元に依存しない収束を達成する、微分プライバシーを満たすAdaGradアルゴリズムを提案する。レグレットバウンドが $ O(\text{Tr}(G_T)/T) $ であることを示し、これにより超過経験的リスクが $ \widetilde{O}(1/\varepsilon n) $ となる。これは、勾配が時間とともに減少する場合、DP-SGDの $ \widetilde{O}(\sqrt{p}/\varepsilon n) $ よりも優れている。

ABSTRACT

We revisit the problem of empirical risk minimziation (ERM) with differential privacy. We show that noisy AdaGrad, given appropriate knowledge and conditions on the subspace from which gradients can be drawn, achieves a regret comparable to traditional AdaGrad plus a well-controlled term due to noise. We show a convergence rate of $O( ext{Tr}(G_T)/T)$, where $G_T$ captures the geometry of the gradient subspace. Since $ ext{Tr}(G_T)=O(\sqrt{T})$ we can obtain faster rates for convex and Lipschitz functions, compared to the $O(1/\sqrt{T})$ rate achieved by known versions of noisy (stochastic) gradient descent with comparable noise variance. In particular, we show that if the gradients lie in a known constant rank subspace, and assuming algorithmic access to an envelope which bounds decaying sensitivity, one can achieve faster convergence to an excess empirical risk of $ ilde O(1/εn)$, where $ε$ is the privacy budget and $n$ the number of samples. Letting $p$ be the problem dimension, this result implies that, by running noisy Adagrad, we can bypass the DP-SGD bound $ ilde O(\sqrt{p}/εn)$ in $T=(εn)^{2/(1+2α)}$ iterations, where $α\geq 0$ is a parameter controlling gradient norm decay, instead of the rate achieved by SGD of $T=ε^2n^2$. Our results operate with general convex functions in both constrained and unconstrained minimization. Along the way, we do a perturbation analysis of noisy AdaGrad of independent interest. Our utility guarantee for the private ERM problem follows as a corollary to the regret guarantee of noisy AdaGrad.

研究の動機と目的

  • 次元 $ p $ に比例して増加する高い超過経験的リスクを抱える、微分プライバシーを満たすERMにおける課題を解決すること。特に、過剰パラメータ化されたモデルにおいて。
  • 微分プライバシー下でもAdaGrad風のレグレットレートを達成するプライベート最適化アルゴリズムを開発すること。
  • 勾配が既知の低ランク部分空間に存在し、勾配ノルムが予測可能に減少する場合に、次元に依存しない収束が可能であることを示すこと。
  • ノイズを含むAdaGradが、非プライベートAdaGradの性能に匹敵する条件を同定すること。同時に、$ (\varepsilon,\delta) $-微分プライバシーを保証すること。
  • 公開データを用いて勾配部分空間を推定してもプライバシーが損なわれず、収束が速くなることを示すこと。

提案手法

  • ランク $ k \ll p $ の、公開で推定された部分空間を用いた勾配前処理を施したノイズ付きAdaGradを導入する。
  • 感度を制御し、プライバシーを保証するために、最大勾配ノルムの定数要因エンvelope $ L(t) $ へのオракルアクセスを用いる。
  • $ \varepsilon $ とサンプルサイズ $ n $ に比例するノイズスケーリング $ \gamma = O(1/\varepsilon n) $ を適用し、$ (\varepsilon,\delta) $-微分プライバシーを維持する。
  • オンライン凸最適化からのレグレットバウンドを、ERMの超過経験的リスク保証に変換するために、オンラインからバッチへの変換を適用する。
  • ノイズ付きAdaGradにおける行列摂動の分析を通じて、環境次元に依存しない安定性および収束特性を導出する。
  • 収束速度が、全次元 $ p $ ではなく、データの幾何構造を捉える適応的前処理行列 $ G_T $ のトレースに依存することを確立する。

実験結果

リサーチクエスチョン

  • RQ1勾配幾何に関する適切な仮定の下で、微分プライバシーを満たすERM設定において、AdaGrad風のレグレットレートを達成できるか?
  • RQ2勾配が既知の低ランク部分空間に存在する場合、プライベートAdaGradは次元に依存しない収束を達成できるか?
  • RQ3勾配ノルムスケジューリングの減少が、プライベート最適化の収束速度に与える影響は何か?
  • RQ4プライバシーを損なわずに、公開データを用いて勾配部分空間を推定でき、収束を速めることができるか?
  • RQ5公開データに依存せずに、非制約的なプライベートERMで $ \widetilde{O}(1/\varepsilon n) $ の超過リスクを達成することは可能か?

主な発見

  • 既知の部分空間と勾配ノルムエンvelope の下で、提案されたノイズ付きAdaGradの超過経験的リスクは $ \widetilde{O}(1/\varepsilon n) $ であり、環境次元 $ p $ に依存しない。
  • レグレットバウンドは $ O(\text{Tr}(G_T)/T) $ であり、$ G_T $ が勾配部分空間の幾何を捉えるため、標準的なプライベートSGDの $ O(1/\sqrt{T}) $ よりも高速な収束が可能である。
  • 任意の $ \alpha > 0 $ に対して、アルゴリズムは $ T = (\varepsilon n)^{2/(1+2\alpha)} $ 回の反復で十分であり、DP-SGDが要請する $ T = \varepsilon^2 n^2 $ よりもはるかに少ない。
  • 環境次元 $ p $ に依存するのではなく、内在次元 $ \text{intdim}(G_T) = \text{Tr}(G_T)/\|G_T\|_{op} $ に依存することで、次元独立性を達成する。
  • 非制約設定では、公開データが不要な場合でも、標準的なDP-SGDが次元独立性を達成する。これは、勾配固有空間における最適解の $ \ell_2 $-ノルムに対する新しい解析を通じて示された。
  • 解析から、勾配ノルムスケジューリングはプライバシーとパフォーマンスの両方にとって不可欠であり、制約付き設定では、部分空間のプライベート推定でも $ \sqrt{p} $ 依存性が解消されないことが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。