Skip to main content
QUICK REVIEW

[논문 리뷰] Fast Dimension Independent Private AdaGrad on Publicly Estimated Subspaces

Peter Kairouz, Mónica Ribero|arXiv (Cornell University)|2020. 08. 14.
Privacy-Preserving Technologies in Data참고 문헌 45인용 수 9
한 줄 요약

이 논문은 공개적으로 추정된 기울기 부분공간과 알려진 기울기 노름의 봉우리(Envelope)를 활용하여 차원에 독립적인 수렴을 달성하는 비밀보장 AdaGrad 알고리즘을 제안한다. 기대값의 손실에 대한 경계는 $ O(\text{Tr}(G_T)/T) $이며, 이는 기대 경험 위험을 $ \widetilde{O}(1/\varepsilon n) $로 이끌며, 기울기가 시간이 지남에 따라 감쇠할 경우 DP-SGD의 $ \widetilde{O}(\sqrt{p}/\varepsilon n) $ 보다 향상된다.

ABSTRACT

We revisit the problem of empirical risk minimziation (ERM) with differential privacy. We show that noisy AdaGrad, given appropriate knowledge and conditions on the subspace from which gradients can be drawn, achieves a regret comparable to traditional AdaGrad plus a well-controlled term due to noise. We show a convergence rate of $O( ext{Tr}(G_T)/T)$, where $G_T$ captures the geometry of the gradient subspace. Since $ ext{Tr}(G_T)=O(\sqrt{T})$ we can obtain faster rates for convex and Lipschitz functions, compared to the $O(1/\sqrt{T})$ rate achieved by known versions of noisy (stochastic) gradient descent with comparable noise variance. In particular, we show that if the gradients lie in a known constant rank subspace, and assuming algorithmic access to an envelope which bounds decaying sensitivity, one can achieve faster convergence to an excess empirical risk of $ ilde O(1/εn)$, where $ε$ is the privacy budget and $n$ the number of samples. Letting $p$ be the problem dimension, this result implies that, by running noisy Adagrad, we can bypass the DP-SGD bound $ ilde O(\sqrt{p}/εn)$ in $T=(εn)^{2/(1+2α)}$ iterations, where $α\geq 0$ is a parameter controlling gradient norm decay, instead of the rate achieved by SGD of $T=ε^2n^2$. Our results operate with general convex functions in both constrained and unconstrained minimization. Along the way, we do a perturbation analysis of noisy AdaGrad of independent interest. Our utility guarantee for the private ERM problem follows as a corollary to the regret guarantee of noisy AdaGrad.

연구 동기 및 목표

  • 차원 $ p $ 와 비례하는 높은 초과 경험 위험을 겪는 비밀보장 ERM 문제를 해결하기 위해, 특히 과다매개변수화된 모델에서의 문제를 해결한다.
  • 차원에 독립적인 수렴을 달성하는 비밀보장 최적화 알고리즘을 개발하여, 차원에 독립적인 수렴을 달성한다.
  • 기울기가 알려진 저랭크 부분공간에 존재하고 기울기 노름이 예측 가능하게 감쇠할 경우, 차원에 독립적인 수렴이 가능함을 보여준다.
  • 노이즈가 섞인 AdaGrad가 비밀보장된 조건에서 비밀보장되지 않은 AdaGrad 성능을 따라잡을 수 있는 조건을 규명한다.
  • 공개 데이터를 사용하여 기울기 부분공간을 추정함으로써 기밀성을 해치지 않으면서 수렴 속도를 향상시킬 수 있음을 보여준다.

제안 방법

  • 공개적으로 추정된 랭크 $ k \ll p $ 의 유한한 랭크 부분공간을 사용하여 기울기 전처리를 수행하는 노이즈가 섞인 AdaGrad를 도입한다.
  • 감도를 제어하고 기밀성을 확보하기 위해, 모든 데이터 샘플을 통틀어 최대 기울기 노름의 상수 요소 봉우리 $ L(t) $ 를 애자일(Oracle) 접근 방식으로 사용한다.
  • 기밀성 예산과 샘플 크기에 기반하여 $ \gamma = O(1/\varepsilon n) $ 비례하는 노이즈 스케일링을 적용하여 $ (\varepsilon,\delta) $-기밀보장 기반을 유지한다.
  • 온라인-배치 변환을 적용하여 온라인 볼록 최적화에서의 경계를 경험 위험 보장으로 전환한다.
  • 노이즈가 섞인 AdaGrad에서의 행렬 편향 분석을 통해, 환경 차원에 의존하지 않는 안정성 및 수렴 성질을 도출한다.
  • 수렴 속도가 적응형 전처리 행렬 $ G_T $ 의 트레이스에 의존하며, 이는 전체 차원 $ p $ 가 아닌 데이터의 본질적 기하학적 특성을 반영한다.

실험 결과

연구 질문

  • RQ1기울기 기하학에 대한 적절한 가정 하에, 비밀보장된 ERM 환경에서 AdaGrad 스타일의 경계를 달성할 수 있는가?
  • RQ2기울기가 알려진 저랭크 부분공간에 존재할 경우, 비밀보장 AdaGrad가 차원에 독립적인 수렴을 달성할 수 있는가?
  • RQ3감쇠하는 기울기 노름 스케줄링이 비밀보장 최적화의 수렴 속도에 어떤 영향을 미치는가?
  • RQ4기밀성을 해치지 않으면서 공개 데이터를 사용해 기울기 부분공간을 추정할 수 있는가? 이는 수렴 속도 향상에 기여하는가?
  • RQ5공개 데이터 없이도 비밀보장된 ERM에서 $ \widetilde{O}(1/\varepsilon n) $ 의 초과 경험 위험을 달성할 수 있는가?

주요 결과

  • 알려진 부분공간과 기울기 노름 봉우리 조건 하에서, 제안된 노이즈가 섞인 AdaGrad 알고리즘의 초과 경험 위험은 $ \widetilde{O}(1/\varepsilon n) $ 이며, 환경 차원 $ p $ 와 무관하다.
  • 경계는 $ O(\text{Tr}(G_T)/T) $ 이며, $ G_T $ 는 기울기 부분공간의 기하학을 반영하므로, 표준 비밀보장 SGD의 $ O(1/\sqrt{T}) $ 보다 더 빠른 수렴을 가능하게 한다.
  • $ \alpha > 0 $ 인 경우, 알고리즘은 단지 $ T = (\varepsilon n)^{2/(1+2\alpha)} $ 번의 반복만으로도 충분하며, DP-SGD가 요구하는 $ T = \varepsilon^2 n^2 $ 보다 훨씬 적다.
  • 이 방법은 $ \sqrt{p} $ 의 의존성을 $ G_T $ 의 본질적 차원 $ \text{intdim}(G_T) $, 즉 $ \text{Tr}(G_T)/\|G_T\|_{op} $ 에 의존성으로 대체함으로써 차원 독립성을 달성한다.
  • 비제약 조건 설정에서는 표준 DP-SGD가 공개 데이터 없이도 차원 독립성을 달성한다. 이는 기울기 고유공간 내에서 최적 해의 $ \ell_2 $-노름에 대한 새로운 분석을 통해 입증된다.
  • 분석 결과, 기울기 노름 스케줄링은 기밀성과 성능에 필수적이며, 제약 조건 하에서는 부분공간의 비밀보장 추정도 여전히 $ \sqrt{p} $ 의 의존성을 제거하지 못한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.