Skip to main content
QUICK REVIEW

[논문 리뷰] Normalized/Clipped SGD with Perturbation for Differentially Private Non-Convex Optimization

Xiaodong Yang, Huishuai Zhang|arXiv (Cornell University)|2022. 06. 27.
Privacy-Preserving Technologies in Data인용 수 7
한 줄 요약

이 논문은 비선형 최적화 설정에서 수렴를 향상시키기 위해 각 샘플 기울기를 클리핑하는 대신 정규화하는, DP-NSGD라고 불리는 차별적(private) 최적화 알고리즘을 제안하고 분석한다. 미약한 부드러움과 유한한 분산 조건 하에서, 기울기 노름 수렴 속도는 $\mathcal{O}\left(\sqrt[4]{\frac{d\log(1/\delta)}{N^{2}\epsilon^{2}}}\right)$를 달성하며, 이는 이전 연구에 비해 더 약한 가정과 더 나은 하이퍼파rameter 안정성을 갖는다.

ABSTRACT

By ensuring differential privacy in the learning algorithms, one can rigorously mitigate the risk of large models memorizing sensitive training data. In this paper, we study two algorithms for this purpose, i.e., DP-SGD and DP-NSGD, which first clip or normalize extit{per-sample} gradients to bound the sensitivity and then add noise to obfuscate the exact information. We analyze the convergence behavior of these two algorithms in the non-convex optimization setting with two common assumptions and achieve a rate $\mathcal{O}\left(\sqrt[4]{\frac{d\log(1/δ)}{N^2ε^2}} ight)$ of the gradient norm for a $d$-dimensional model, $N$ samples and $(ε,δ)$-DP, which improves over previous bounds under much weaker assumptions. Specifically, we introduce a regularizing factor in DP-NSGD and show that it is crucial in the convergence proof and subtly controls the bias and noise trade-off. Our proof deliberately handles the per-sample gradient clipping and normalization that are specified for the private setting. Empirically, we demonstrate that these two algorithms achieve similar best accuracy while DP-NSGD is comparatively easier to tune than DP-SGD and hence may help further save the privacy budget when accounting the tuning effort.

연구 동기 및 목표

  • DP-SGD에서 기울기 클리핑으로 인한 차별적 비선형 최적화의 수렴 부족 문제를 해결하기 위해.
  • 기울기 클리핑 대신 각 샘플 기울기를 정규화하는 새로운 변종인 DP-NSGD의 수렴 행동을 분석하기 위해.
  • 이전 연구보다 더 약한 가정 하에서 더 타이트한 수렴 속도를 확립하기 위해, 특히 전역 기울기 상한을 피하기 위해.
  • 실증적으로 DP-NSGD가 DP-SGD보다 훨씬 더 조정하기 쉬우면서도 유사한 정확도를 달성하며, 프라이버시 예산 소비를 줄일 수 있음을 보여주기 위해.
  • DP-NSGD의 수렴 증명에서 편향-노이즈 트레이드오프를 제어하는 데 핵심적인 역할을 하는 정규화 인자(regularizer)의 중요성을 밝혀내기 위해.

제안 방법

  • 정규화 인자 $ r > 0 $ 를 사용하여 각 샘플 기울기 클리핑을 대체하는 DP-NSGD를 도입하며, 이는 $ h^{(i)} = \frac{1}{r + \|\mathbf{g}^{(i)}\|} $ 로 정의된다.
  • 차별적 프라이버시를 확보하기 위해 정규화된 기울기들에 가우시안 노이즈 $ \mathbf{z} \sim \mathcal{N}(0, \sigma^2 \mathbf{I}_d) $ 를 적용한다.
  • Renyi 차별적 프라이버시(RDP)와 무작위로 추출하지 않은 서브샘플링을 통한 프라이버시 보존 기법을 사용하여 프라이버시 보장을 유도한다.
  • RDP의 기능적 시각과 복합 정리(composition theorems)를 활용하여 프라이버시 손실를 근사화하며, [8]의 결과를 활용해 서브샘플드 가우시안 메커니즘을 분석한다.
  • 최적화 과정에서 편향과 노이즈의 균형을 맞추고, 악조건을 방지하기 위해 정규화 인자 $ r $ 를 도입한다.
  • 두 가지 미약한 가정 하에서 수렴을 분석한다: $ (L_0, L_1) $-일반화된 부드러움과 $ (\tau_0, \tau_1) $-유한한 기울기 분산.

실험 결과

연구 질문

  • RQ1차별적 비선형 최적화에서 기울기 정규화가 기울기 클리핑보다 수렴 속도와 하이퍼파rameter 안정성 측면에서 뛰어나다는가?
  • RQ2기울기 노름이 증가함에 따라 부드러움과 기울기 분산이 증가할 수 있는 약한 가정 하에서 DP-NSGD의 수렴 속도는 어떠한가?
  • RQ3정규화 요소에 정규화 인자 $ r $ 가 포함될 경우 DP-NSGD의 편향-노이즈 트레이드오프에 어떤 영향을 미치는가?
  • RQ4실제로 DP-NSGD가 DP-SGD보다 더 나은 프라이버시-정확도 트레이드오프를 달성할 수 있는가, 특히 튜닝 노력의 측면에서?
  • RQ5서브샘플드 가우시안 메커니즘을 사용할 때 DP-NSGD에 대해 더 타이트한 경계를 제공하는 프라이버시 회계 프레임워크는 무엇인가?

주요 결과

  • DP-NSGD는 $ (L_0, L_1) $-일반화된 부드러움과 $ (\tau_0, \tau_1) $-유한한 기울기 분산라는 두 가지 미약한 가정 하에서 기울기 노름 수렴 속도 $ \mathcal{O}\left(\sqrt[4]{\frac{d\log(1/\delta)}{N^{2}\epsilon^{2}}}\right) $ 를 달성한다.
  • 이전 연구에서 요구하는 더 강력한 가정(예: 기울기의 전역 상한)이 필요로 하지 않아, 이는 더 나은 수렴 성능을 의미한다.
  • 정규화 요소에 포함된 정규화 인자 $ r $ 는 수렴 증명에 필수적이며, 편향과 노이즈의 트레이드오프를 효과적으로 제어한다.
  • 실증 결과에 따르면 DP-NSGD는 DP-SGD와 유사한 최고의 정확도를 달성하지만, 훨씬 더 조정하기 쉬우며, 광범위한 하이퍼파rameter 검색이 필요로 하지 않는다.
  • 튜닝 노력이 줄어들면서 프라이버시 예산이 더 효율적으로 사용되므로, DP-NSGD는 실질적인 차별적 학습에서 더 선호될 수 있다.
  • 분석은 Renyi 차별적 프라이버시와 무작위로 추출하지 않은 서브샘플링 기반의 정교한 프라이버시 회계 프레임워크를 활용하여, 이전 접근보다 더 타이트한 경계를 도출한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.