Skip to main content
QUICK REVIEW

[논문 리뷰] Tight and Robust Private Mean Estimation with Few Users

Hossein Esfandiari, Vahab Mirrokni|arXiv (Cornell University)|2021. 10. 22.
Privacy-Preserving Technologies in Data참고 문헌 24인용 수 5
한 줄 요약

이 논문은 사용자 수준의 비밀성 보장 하에서 고차원 데이터에 대한 새로운 비밀성 보장 평균 추정 기법을 제안한다. 이 기법은 사용자 수와 사용자당 샘플 수 사이의 거의 최적의 트레이드오프를 달성하며, 최소한 $ O(1/\varepsilon \log(1/\delta)) $명의 사용자만으로도 가능하다. 이 방법은 최대 49%의 사용자 데이터 오염에 대해 강건하며, 차원에 영향을 받지 않는 엄밀한 평균 추정 한계를 통해 스토케스틱 볼록 최적화 및 경사 하강법의 개선된 비밀성 학습을 가능하게 한다.

ABSTRACT

In this work, we study high-dimensional mean estimation under user-level differential privacy, and design an $(\varepsilon,δ)$-differentially private mechanism using as few users as possible. In particular, we provide a nearly optimal trade-off between the number of users and the number of samples per user required for private mean estimation, even when the number of users is as low as $O(\frac{1}{\varepsilon}\log\frac{1}δ)$. Interestingly, this bound on the number of \emph{users} is independent of the dimension (though the number of \emph{samples per user} is allowed to depend polynomially on the dimension), unlike the previous work that requires the number of users to depend polynomially on the dimension. This resolves a problem first proposed by Amin et al. Moreover, our mechanism is robust against corruptions in up to $49\%$ of the users. Finally, our results also apply to optimal algorithms for privately learning discrete distributions with few users, answering a question of Liu et al., and a broader range of problems such as stochastic convex optimization and a variant of stochastic gradient descent via a reduction to differentially private mean estimation.

연구 동기 및 목표

  • 사용자 수가 적을 때 사용자 수준 비밀성 보장 하에서 비밀성 평균 추정 문제를 해결함.
  • 정확한 평균 추정을 위해 사용자 수와 사용자당 샘플 수 사이의 거의 최적의 트레이드오프를 달성함.
  • 최대 49%의 사용자에서 데이터 오염에 대해 강건성을 확보하여 실용적 신뢰도 향상.
  • 비밀성 평균 추정으로의 감소를 통해 이산 분포의 비밀성 학습 및 스트로케스틱 볼록 최적화로 결과 확장.

제안 방법

  • 각 사용자가 다수의 샘플을 기여하는 사용자 수준 비밀성 보장 하에서 고차원 평균 추정을 위한 새로운 비밀성 보장 기법 제안.
  • 최대 49%의 사용자 데이터가 오염되거나 상관관계가 있어도 정확도를 유지하는 강건한 추정 절차 설계.
  • 차원에 영향을 받지 않는 분석 프레임워크를 사용하여 필요한 사용자 수가 $ O(1/\varepsilon \log(1/\delta)) $로 증가함을 보여주며, 데이터 차원 $ d $ 와 무관하게 유지됨.
  • 비밀성 스트로케스틱 볼록 최적화 및 투영된 스트로케스틱 경사 하강법을 비밀성 평균 추정으로 감소시켜, 더 엄밀한 비밀성 및 정확도 한계 확보.
  • 강력한 조합 정리와 노이즈 캘리브레이션 기법을 활용하여 다중 반복 동안 $ (\varepsilon,\delta) $-비밀성 보장 유지.
  • 차원에 대해 다항식적으로 의존하는 평균 추정 오차의 새로운 분석을 도입하여, $ \delta $ 는 로그적으로만 의존함으로써 저사용자 환경에서의 확장성 향상.

실험 결과

연구 질문

  • RQ1사용자 수준 비밀성 보장 하에서 정확한 비밀성 평균 추정을 달성하기 위해 필요한 최소 사용자 수는 얼마인가?
  • RQ2비밀성 평균 추정이 일정 비율의 사용자에서 데이터 오염에 대해 강건하게 만들 수 있는가?
  • RQ3비밀성 평균 추정에서 필요한 사용자 수가 데이터 차원에 따라 증가하는가, 아니면 차원에 독립적으로 유지할 수 있는가?
  • RQ4비밀성 평균 추정을 어떻게 활용하여 저사용자 환경에서 비밀성 스트로케스틱 볼록 최적화 및 경사 하강법을 향상시킬 수 있는가?

주요 결과

  • 제안된 기법은 데이터 차원 $ d $ 와 무관하게 오직 $ O(1/\varepsilon \log(1/\delta)) $명의 사용자로만 $ (\varepsilon,\delta) $-비밀성 보장 달성하며, Amin 등이 제기한 열린 문제를 해결함.
  • 최대 49%의 사용자 데이터가 오염되거나 상관관계가 있어도 정확도와 비밀성 보장이 유지됨.
  • 이산 분포의 비밀성 학습에 대해 최적의 샘플 복잡도 제공하며, Liu 등이 제기한 질문에 답함.
  • 개선된 평균 추정 프레임워크로 인해 비밀성 스트로케스틱 볼록 최적화에 필요한 사용자 수가 $ \tilde{\Omega}(\sqrt{dT}/\varepsilon) $ 에서 $ \tilde{\Omega}(\sqrt{T}/\varepsilon) $ 로 감소하여 명시적인 $ d $ 의 의존성 제거.
  • 투영된 스트로케스틱 경사 하강법의 경우 오차 한계가 $ \tilde{O}\left(\frac{R^{2}H}{T}+R\sigma\cdot\frac{d}{n\sqrt{m}\cdot\varepsilon}\right) $ 로 향상되었으며, 이제 사용자 수가 $ d $ 와 무관해짐.
  • 스트로케스틱 볼록 최적화에서 더 엄밀한 비밀성-정확도 트레이드오프를 가능하게 하며, 필요한 사용자 수가 $ \tilde{\Omega}(\varepsilon^{-1} + \min(\sqrt[3]{mH^{2}R^{2}/(G\underline{G}\cdot\varepsilon^{4})}, HR\sqrt{m}/(d\sigma\sqrt{\varepsilon}))) $ 로 스케일링됨으로써 이전의 한계보다 크게 향상됨.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.