[논문 리뷰] On the Intrinsic Privacy of Stochastic Gradient Descent
이 논문은 확률적 경사 하강법(SGD)의 내재적 프라이버시를 그 자체의 무작위성 분석을 통해 조사하며, SGD의 확률적 특성이 각각 MNIST, Adult, Forest Covertype 데이터셋에서 $\epsilon$ 값 7.8, 6.9, 2.8을 제공함으로써 자연스러운 프라이버시를 제공함을 보여준다. 또한, 이 내재적 노이즈를 보완하여 차별적 프라이버시 하에서 더 높은 유틸리티를 달성하는 방법을 제안하며, $\epsilon = 1$일 때 노이즈 없는 모델과의 유틸리티 격차를 최대 10.07%까지 줄인다.
Private learning algorithms have been proposed that ensure strong differential-privacy (DP) guarantees, however they often come at a cost to utility. Meanwhile, stochastic gradient descent (SGD) contains intrinsic randomness which has not been leveraged for privacy. In this work, we take the first step towards analysing the intrinsic privacy properties of SGD. Our primary contribution is a large-scale empirical analysis of SGD on convex and non-convex objectives. We evaluate the inherent variability due to the stochasticity in SGD on 3 datasets and calculate the $\epsilon$ values due to the intrinsic noise. First, we show that the variability in model parameters due to the random sampling almost always exceeds that due to changes in the data. We observe that SGD provides intrinsic $\epsilon$ values of 7.8, 6.9, and 2.8 on MNIST, Adult, and Forest Covertype datasets respectively. Next, we propose a method to augment the intrinsic noise of SGD to achieve the desired $\epsilon$. Our augmented SGD outputs models that outperform existing approaches with the same privacy guarantee, closing the gap to noiseless utility between 0.19% and 10.07%. Finally, we show that the existing theoretical bound on the sensitivity of SGD is not tight. By estimating the tightest bound empirically, we achieve near-noiseless performance at $\epsilon = 1$, closing the utility gap to the noiseless model between 3.13% and 100%. Our experiments provide concrete evidence that changing the seed in SGD is likely to have a far greater impact on the model than excluding any given training example. By accounting for this intrinsic randomness, higher utility can be achieved without sacrificing further privacy. With these results, we hope to inspire the research community to further explore and characterise the randomness in SGD, its impact on privacy, and the parallels with generalisation in machine learning.
연구 동기 및 목표
- SGD의 내재적 무작위성이 외부 노이즈를 추가하지 않고도 차별적 프라이버시에 기여하는지 이해한다.
- 다양한 데이터셋과 목적함수에서 SGD의 무작위성에 의해 제공되는 내재적 프라이버시($\epsilon$ 기준)를 정량화한다.
- 같은 차별적 프라이버시 보장 하에서 SGD의 내재적 노이즈를 향상시켜 더 나은 유틸리티를 달성할 수 있는 방법을 개발한다.
- SGD의 이론적 민감도 한계를 재평가하며, 실질적으로 이는 타이트하지 않음을 보여준다.
- SGD의 내재적 무작위성, 모델 일반화, 프라이버시 간의 관계를 탐색하여 향후 연구에 영감을 주기 위함이다.
제안 방법
- 세 가지 데이터셋(MNIST, Adult, Forest Covertype)에서 SGD의 무작위 샘플링에 의한 모델 파라미터 변동성을 경험적으로 측정한다.
- 모델 업데이트의 민감도를 사용하여, 한 개의 데이터 포인트를 포함하거나 제거했을 때 모델 파라미터의 차이를 비교함으로써 내재적 $\epsilon$ 값을 계산한다.
- 목표 $\epsilon$ 값에 도달하면서도 모델 유틸리티를 유지할 수 있도록 SGD의 내재적 확률적 특성을 스케일링하는 노이즈 보완 기법을 제안한다.
- 이론적 상한값에 의존하는 대신, SGD에 대해 가장 타이트한 민감도 한계를 경험적으로 추정한다.
- 증강된 내재적 노이즈를 사용해 모델을 훈련하고, 동일한 $\epsilon$ 예산 하에서 기존의 차별적 프라이버시 방법과 성능을 비교한다.
- 볼록 및 비볼록 목적함수에 대한 대규모 실험을 통해 발견의 강건성을 검증한다.
실험 결과
연구 질문
- RQ1표준 기계학습 데이터셋에서 SGD의 무작위성은 어떤 내재적 $\epsilon$ 값을 제공하는가?
- RQ2SGD의 무작위 샘플링에 의한 모델 파라미터 변동성은 단일 학습 예제를 변경했을 때 발생하는 변동성과 어떻게 비교되는가?
- RQ3기존 방법과 비교해, SGD의 내재적 노이즈를 보완함으로써 동일한 차별적 프라이버시 보장 하에서 모델 유틸리티를 향상시킬 수 있는가?
- RQ4실제로 SGD의 이론적 민감도 한계는 얼마나 타이트한가? 경험적 추정이 더 나은 성능을 낼 수 있는가?
- RQ5SGD의 내재적 무작위성은 어떤 개별 학습 예제도보다 모델 출력에 더 큰 영향을 미치는가?
주요 결과
- SGD의 내재적 확률적 특성은 MNIST에서 $\epsilon$ 값 7.8, Adult에서 6.9, Forest Covertype에서 2.8를 제공하며, 상당한 자연스러운 프라이버시를 보여준다.
- 무작위 샘플링에 의한 모델 파라미터 변동성이, 어떤 단일 학습 예제를 변경했을 때 발생하는 변동성보다 크며, 이는 랜덤 시드를 변경하는 것이 데이터 포인트 하나를 제거하는 것보다 더 큰 영향을 미친다는 것을 시사한다.
- SGD의 내재적 노이즈를 보완함으로써 제안된 방법은 $\epsilon = 1$일 때 노이즈 없는 모델과의 유틸리티 격차를 0.19%에서 10.07%까지 줄여 기존의 차별적 프라이버시 접근법을 초월한다.
- SGD에 대해 경험적으로 추정한 가장 타이트한 민감도 한계는 $\epsilon = 1$일 때 거의 노이즈 없는 성능을 달성하며, 노이즈 없는 모델과의 유틸리티 격차를 3.13%에서 100%까지 줄였다.
- SGD의 이론적 민감도 한계는 실질적으로 타이트하지 않으며, 민감도의 경험적 추정은 동일한 프라이버시 예산 하에서 유의미하게 향상된 유틸리티를 이끈다.
- SGD에서 랜덤 시드를 변경하는 것이 어떤 단일 학습 예제도보다 모델 출력에 더 큰 영향을 미치며, 이는 내재적 무작위성이 모델 변동성에서 지배적인 역할을 한다는 것을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.