Skip to main content
QUICK REVIEW

[논문 리뷰] Privacy of Noisy Stochastic Gradient Descent: More Iterations without More Privacy Loss

Jason M. Altschuler, Kunal Talwar|arXiv (Cornell University)|2022. 05. 27.
Privacy-Preserving Technologies in Data인용 수 9
한 줄 요약

이 논문은 반복 횟수가 증가함에 따라 무한한 프라이버시 손실을 겪지 않는 노이즈가 있는 확률적 경사 하강법(Noisy-SGD)이지만, 장기간의 반복 후에 프라이버시 손실이 포화 상태에 도달한다는 점을 입증함으로써, 미분적 프라이버시 분야에서 오랫동안 남아있던 열린 문제를 해결한다. 저자들은 최적 운반 이론과 샘플링 기반 보정 기법을 활용한 새로운 기법을 도입하여 엄밀한 프라이버시 경계를 확립하였으며, 이는 더 긴 학습 기간이 초기 단계 이후에 프라이버시를 악화시키지 않음을 시사한다. 이는 이전 분석에서 잘못 예측한 무한한 증가 추세와는 정반대이다.

ABSTRACT

A central issue in machine learning is how to train models on sensitive user data. Industry has widely adopted a simple algorithm: Stochastic Gradient Descent with noise (a.k.a. Stochastic Gradient Langevin Dynamics). However, foundational theoretical questions about this algorithm's privacy loss remain open -- even in the seemingly simple setting of smooth convex losses over a bounded domain. Our main result resolves these questions: for a large range of parameters, we characterize the differential privacy up to a constant factor. This result reveals that all previous analyses for this setting have the wrong qualitative behavior. Specifically, while previous privacy analyses increase ad infinitum in the number of iterations, we show that after a small burn-in period, running SGD longer leaks no further privacy. Our analysis departs from previous approaches based on fast mixing, instead using techniques based on optimal transport (namely, Privacy Amplification by Iteration) and the Sampled Gaussian Mechanism (namely, Privacy Amplification by Sampling). Our techniques readily extend to other settings, e.g., strongly convex losses, non-uniform stepsizes, arbitrary batch sizes, and random or cyclic choice of batches.

연구 동기 및 목표

  • Noisy-SGD의 프라이버시 손실이 반복 횟수의 증가에 따라 무한히 증가하는지 여부라는 근본적인 열린 질문을 해결하기 위해.
  • 유계 도메인에서 부드러운 볼록 설정에서 Noisy-SGD에 대한 미분적 프라이버시 파라미터를 엄밀하게 특성화하기 위해.
  • 기존 분석이 반복 횟수 증가에 따라 무한한 프라이버시 악화를 잘못 예측한 점을 도전하고 수정하기 위해.
  • 이dealized 가정을 초월해 적용 가능한 엄밀한 이론적 프레임워크를 개발하기 위해, 비균일한 스텝 사이즈, 임의의 배치 크기, 순환 업데이트를 포함하여 적용 가능하도록 하기 위해.

제안 방법

  • 저자들은 이웃 데이터셋에서 Noisy-SGD의 궤적 간 발산을 제한하기 위해 최적 운반 이론을 활용하는 새로운 프라이버시 분석 프레임워크인 '반복 기반 프라이버시 보정'을 도입한다.
  • 이를 샘플링 기반 보정과 결합하여, 반복 횟수 T가 증가함에 따라 여전히 유한한 남은 레니 지수 프라이버시(RDP) 경계를 도출한다.
  • 이 방법은 노이즈를 두 구성요소로 분해함으로써 초기 반복과 후기 반복에 대해 각각 다른 처리를 가능하게 하여, T에 따라 증가하지 않는 비어 있지 않은 경계를 확보한다.
  • 핵심적인 기술적 혁신은 시간에 따라 변화하는 노이즈 분포의 매개변수화를 통해 알고리즘 궤적의 수축을 모델링하는 것이다.
  • 반복 기반 보정 원리를 정교하게 적용하여, 강력한 볼록 손실, 비균일 스텝 사이즈, 순환 배치 업데이트에 대해서도 분석을 확장한다.
  • 비밀 보장 경계의 수치적 계산은 노이즈 분해에 대한 삼분 탐색과 임계 반복 횟수 T̃의 폐쇄형 최적화를 통해 가능해진다.

실험 결과

연구 질문

  • RQ1반복 횟수 T의 증가에 따라 Noisy-SGD의 프라이버시 손실이 무한히 증가하는가?
  • RQ2초기 번화기 이후로도 일정하게 유지되는, 비어 있지 않은 엄밀한 프라이버시 경계를 Noisy-SGD에 도출할 수 있는가?
  • RQ3기존의 조합 및 빠른 혼합 가정 기반 분석은 시간에 따른 프라이버시 악화 예측에서 본질적으로 잘못된 예측을 내놓는가?
  • RQ4반복 기반 보정 기법은 Noisy-SGD의 i.i.d. 또는 정적일 수 없는 업데이트 시퀀스에 효과적으로 적용될 수 있는가?
  • RQ5스텝 사이즈, 배치 크기, 업데이트 순서(예: 순환 대비 무작위)의 변동에 대해 강건한 프라이버시 경계를 도출할 수 있는가?

주요 결과

  • Noisy-SGD의 프라이버시 손실은 반복 횟수의 증가에 따라 무한히 증가하지 않으며, 오히려 짧은 번화기 이후 포화 상태에 도달한다. 이는 이전 분석에서 잘못 예측한 무한한 증가 추세와 정반대이다.
  • 유계 도메인에서 부드러운 볼록 손실에 대해, 레니 지수 프라이버시(RDP) 파라미터 ε는 T에 독립적인 상수로 유계되며, 상수 인자 수준까지 유지된다.
  • 제안된 경계는 엄밀하며, 실제로 관찰되는 바와 일치한다. 즉, 더 긴 학습이 더 나쁜 프라이버시를 초래하지는 않는다.
  • 분석은 이전 방법이 조합과 빠른 혼합 가정에 기반한 분석이 프라이버시 악화에 대해 본질적으로 잘못된 예측을 내놓는다는 것을 드러낸다.
  • 이 경계는 다양한 설정에 적용 가능하다: 강력한 볼록 손실, 비균일 스텝 사이즈, 임의의 배치 크기, 그리고 무작위 또는 순환 배치 선택 모두에 대해 적용 가능하다.
  • 프라이버시 경계의 수치적 계산은 효율적이며, 큰 T에 대해서도 최소한의 프라이버시 오버헤드로 실용적 구현이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.