Skip to main content
QUICK REVIEW

[논문 리뷰] Bypassing the Ambient Dimension: Private SGD with Gradient Subspace Identification

Yingxue Zhou, Steven Z. Wu|arXiv (Cornell University)|2020. 07. 07.
Privacy-Preserving Technologies in Data참고 문헌 33인용 수 20
한 줄 요약

이 논문은 표본 수 n이 파라미터 수 p보다 훨씬 작은 오버파rameterized 모델에서의 고오차 문제를 해결하기 위해, 소량의 공공 데이터셋에서 추출한 저차원 부분공간에 기울기를 투영함으로써 기울기 업데이트에 포함된 노이즈를 줄이는 새로운 차별적(private) 최적화 방법인 Projected DP-SGD를 제안한다. 딥 네트워크 기울기의 내재된 저차원 구조를 활용함으로써, 기존 DP-SGD에서 발생하는 환경 차원 의존성 문제를 회피하면서도, 개인정보 유출 손실을 증가시키지 않고도 모델 정확도를 크게 향상시킨다. 이는 특히 높은 개인정보 보호 수준에서 성능 향상이 두드러진다.

ABSTRACT

Differentially private SGD (DP-SGD) is one of the most popular methods for solving differentially private empirical risk minimization (ERM). Due to its noisy perturbation on each gradient update, the error rate of DP-SGD scales with the ambient dimension $p$, the number of parameters in the model. Such dependence can be problematic for over-parameterized models where $p \\gg n$, the number of training samples. Existing lower bounds on private ERM show that such dependence on $p$ is inevitable in the worst case. In this paper, we circumvent the dependence on the ambient dimension by leveraging a low-dimensional structure of gradient space in deep networks -- that is, the stochastic gradients for deep nets usually stay in a low dimensional subspace in the training process. We propose Projected DP-SGD that performs noise reduction by projecting the noisy gradients to a low-dimensional subspace, which is given by the top gradient eigenspace on a small public dataset. We provide a general sample complexity analysis on the public dataset for the gradient subspace identification problem and demonstrate that under certain low-dimensional assumptions the public sample complexity only grows logarithmically in $p$. Finally, we provide a theoretical analysis and empirical evaluations to show that our method can substantially improve the accuracy of DP-SGD in the high privacy regime (corresponding to low privacy loss $\\epsilon$).

연구 동기 및 목표

  • 파라미터 수 p가 훈련 샘플 수 n보다 훨씬 큰 오버파rameterized 모델에서 DP-SGD의 높은 오차율 문제를 해결하기 위해.
  • 딥 네트워크 기울기 공간의 저차원 구조를 활용하여, DP-SGD에 내재된 p-의존 오차 스케일링 문제를 극복하기 위해.
  • 소량의 공공 데이터셋을 사용하여 저차원 기울기 부분공간을 식별하고 노이즈 감소를 위한 실용적인 비밀리티 최적화 프레임워크를 개발하기 위해.
  • 저차원 가정 하에, 부분공간 식별을 위한 공공 데이터 샘플 복잡도가 p에 대해 로그적으로 증가함을 보여주기 위해.
  • 고비밀리티 설정에서 일반화 성능과 비밀리티-정확도 트레이드오프 향상을 실증적으로 검증하기 위해.

제안 방법

  • 이 방법은 공공 데이터셋에서 계산한 기울기 이阶모멘트 행렬의 상위-k 고유벡터가 생성하는 부분공간에 노이즈가 있는 기울기를 투영함으로써, Projected DP-SGD를 도입한다.
  • 기울기 부분공간은 소량의 공공 데이터셋 S_h에서의 기울기 공분산 행렬의 상위-k 고유공간을 사용하여 식별되며, 이는 비밀리티 예산을 증가시키지 않고도 노이즈 영향을 줄인다.
  • 알고리즘은 전체 p차원 공간에 노이즈를 주입한 후, 재구성 오차를 최소화하기 위해 k차원 부분공간으로 투영하는 비밀리티 SGD를 수행한다.
  • 기울기 부분공간은 주기적으로(예: s 반복마다) 업데이트되어 학습 중 기울기 구조의 변화에 적응하며, 이는 계산 비용을 절감한다.
  • 이론적 분석을 통해, 저랭크 기울기 가정 하에 정확한 부분공간 식별을 위한 공공 데이터 샘플 복잡도가 p에 대해 로그적으로 증가함을 보였다.
  • 이 방법은 모듈러식이며, 표준 기울기 흐트림을 부분공간 투영된 노이즈로 대체함으로써 기존 DP-SGD 구현에 쉽게 통합할 수 있다.

실험 결과

연구 질문

  • RQ1딥 네트워크 기울기의 저차원 구조를 활용함으로써, DP-SGD의 환경 차원 의존성을 완화할 수 있는가?
  • RQ2소량의 공공 데이터셋을 사용하여 기울기 부분공간을 식별하면, 개인 정보 보호 학습에서 일반화 성능이 향상되는가?
  • RQ3공공 데이터셋의 크기가 부분공간 식별 과정의 정확도와 안정성에 어떤 영향을 미치는가?
  • RQ4기울기 부분공간 업데이트 빈도를 낮출 경우, 계산 비용과 성능 간의 상충 관계는 어떻게 되는가?
  • RQ5고비밀리티 환경에서 표준 DP-SGD에 비해 이 방법이 더 나은 비밀리티-정확도 트레이드오프를 달성할 수 있는가?

주요 결과

  • k=50일 때 Projected DP-SGD는 MNIST와 Fashion-MNIST에서 표준 DP-SGD보다 높은 테스트 정확도를 달성하였으며, 이는 25,000개의 파라미터 중 50개의 부분공간으로 기울기를 투영한 것임에도 불구하고 성능 향상을 보였다.
  • ε=0.23일 때, m=150개의 공공 샘플을 사용한 PDP-SGD는 m=50일 때보다 더 높은 정확도를 기록하며 더 나은 부분공간 추정 성능을 보였다.
  • k=50일 때 PDP-SGD는 재구성 오차와 노이즈 감소 간의 균형이 더 우수하여, k=10, 20, 30보다 일관되게 뛰어난 성능을 보였다.
  • 부분공간 업데이트 빈도를 낮추는 것(예: 10 또는 20회 반복마다 업데이트)은 정확도에 미미한 하락만을 초래하여 상당한 계산 비용 절감이 가능했다.
  • 고비밀리티 환경(낮은 ε)에서 PDP-SGD는 DP-SGD에 비해 모델 정확도를 크게 향상시켰으며, 부분공간 투영을 통한 효과적인 노이즈 감소를 입증했다.
  • 실증 결과는 딥 네트워크에서 기울기 방향이 저차원 부분공간에 존재함을 확인하였으며, 이는 본 방법의 핵심 가정을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.