Skip to main content
QUICK REVIEW

[논문 리뷰] Private Adaptive Gradient Methods for Convex Optimization

Hilal Asi, John C. Duchi|arXiv (Cornell University)|2021. 06. 25.
Stochastic Gradient Optimization Techniques인용 수 12
한 줄 요약

이 논문은 기울기 기하학을 고려한 비등방성 노이즈와 클리핑을 사용하는 차별적(private) 적응형 최적화 알고리즘인 Pagan을 소개한다. 기존의 비차별적 SGD보다 개선된 성능을 보이며, 균일한(가우시안) 노이즈 대신 실제 기울기 크기에 맞게 노이즈를 조정함으로써, 비등방성, 고차원 설정에서 더 날카운 감소 경계와 뛰어난 경험적 성능을 달성한다.

ABSTRACT

We study adaptive methods for differentially private convex optimization, proposing and analyzing differentially private variants of a Stochastic Gradient Descent (SGD) algorithm with adaptive stepsizes, as well as the AdaGrad algorithm. We provide upper bounds on the regret of both algorithms and show that the bounds are (worst-case) optimal. As a consequence of our development, we show that our private versions of AdaGrad outperform adaptive SGD, which in turn outperforms traditional SGD in scenarios with non-isotropic gradients where (non-private) Adagrad provably outperforms SGD. The major challenge is that the isotropic noise typically added for privacy dominates the signal in gradient geometry for high-dimensional problems; approaches to this that effectively optimize over lower-dimensional subspaces simply ignore the actual problems that varying gradient geometries introduce. In contrast, we study non-isotropic clipping and noise addition, developing a principled theoretical approach; the consequent procedures also enjoy significantly stronger empirical performance than prior approaches.

연구 동기 및 목표

  • 기울기 기하학이 중요한 고차원, 비등방성 문제에서 표준 비차별적 SGD의 비최적성 문제를 해결한다.
  • 비차별 최적화에서 등방성 노이즈의 한계를 극복한다. 등방성 노이즈는 신호를 지배하고 기울기 구조를 忽略한다.
  • 실제 기울기 크기와 기하학을 반영하는 원칙적인 비차별 적응형 방법을 개발하여 수렴 속도를 향상시킨다.
  • 실제 분포 가정 하에 비차별 적응형 방법이 비적응형 방법보다 뛰어난 성능을 낼 수 있음을 입증한다.
  • 이론적 감소 경계와 하한을 제시하여 제안된 방법의 날카운성과 최적성을 입증한다.

제안 방법

  • 관측된 기울기 노름에 기반한 비등방성 노이즈와 적응형 클리핑을 사용하는 AdaGrad의 비차별적 변형인 Pagan을 제안한다.
  • 실제 기울기 크기에 비례하여 노이즈를 스케일링하는 비차별 적응 메커니즘을 도입하여 최악의 경우 가정을 피한다.
  • moment accountant 분석 (Abadi 등)을 사용하여 적응형 노이즈와 클리핑 하에서의 비밀유지 손실을 추적한다.
  • 대각 헤시안 근사법을 적용하여 기울기 이阶 모멘트를 효율적으로 추정함으로써, 전체 공분산 계산 없이 실시간 적응을 가능하게 한다.
  • 저차원 부분공간 가정 없이 기울기 내 기하학적 구조를 활용하면서도 비밀을 유지하는 비차별 최적화 프레임워크를 설계한다.
  • WikiText-103를 사용하여 LSTM 언어 모델에서 Pagan을 구현하고, DP-SGD 및 비차별 기준선과 비교 평가한다.

실험 결과

연구 질문

  • RQ1비등방성 설정에서 기하학적 이점을 지닌 적응형 최적화 방법을 비차별적으로 만들 수 있는가?
  • RQ2비차별 적응형 방법에서 비등방성 노이즈 추가가 고차원 문제에서 등방성 노이즈보다 더 나은 수렴 성능을 낼 수 있는가?
  • RQ3일반화성과 비밀-정확도 트레이드오프 측면에서 비차별 적응형 방법은 표준 DP-SGD보다 어떻게 비교되는가?
  • RQ4자연적인 분포 가정 하에 비차별 적응형 방법에 대한 이론적 감소 경계를 유도하고, 그 경계가 날카로운지 입증할 수 있는가?
  • RQ5실제 NLP 과제에서 Pagan의 경험적 성능은 다른 비차별 및 비차별 최적화 방법과 비교해 어떻게 되는가?

주요 결과

  • 모든 비밀 수준(ε = 0.5, 1, 3)에서 Pagan은 DP-SGD와 Pasan보다 유의미하게 낮은 테스트 퍼플렉서티를 달성한다. ε = 0.5일 때 테스트 퍼플렉서티는 291.41로, DP-SGD의 350.23보다 낮다.
  • ε = 3일 때 Pagan은 테스트 퍼플렉서티를 224.82로 줄여 Pasan(238.87)과 DP-SGD(238.44)를 모두 능가하며, 비차별 설정에서의 일관된 우수성을 입증한다.
  • Pagan의 감소 경계는 최악의 경우 최적이며, 기존의 비차별 SGD와 달리 실제 기울기 기하학을 반영한다. 기존 방법은 최악의 기울기 크기에 의존한다.
  • 비등방성 기울기가 존재하는 상황에서 Pagan은 적응형 및 비적응형 비차별 SGD를 모두 능가한다. 이는 비차별 AdaGrad가 SGD를 능가하는 것으로 알려진 상황에서 성립한다.
  • 초기화 파라미터 잘못 설정에 대해 강건하며, 모멘트 추정의 곱셈 오차가 있을 경우 수렴 보장이 상수 배수로만 악화된다.
  • PDP-SGD와 마찬가지로 저차원 부분공간 투영의 메모리 및 계산 부담을 피함으로써, 성능 손실 없이 대규모 모델에 대해 확장 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.