[논문 리뷰] Hiding Among the Clones: A Simple and Nearly Optimal Analysis of Privacy Amplification by Shuffling
이 논문은 차분 모델의 비밀유지 강화 분석에 대해 새로운 간소화된 분석을 제시하며, 적응형 ${\varepsilon}_0$-차분적 개인 정보 보호를 갖는 국소 랜덤라이저 시퀀스가 $(O((1-e^{-{\varepsilon}_0})\sqrt{e^{{\varepsilon}_0}\log(1/\delta)/n}}, \delta)$-개인정보 보호 알고리즘을 유도함을 보여준다. 이 방법은 ${\varepsilon}_0$에 대해 점점 더 최적의 점근적 의존도를 달성하며, 이는 이전의 경계보다 크게 향상되었고, 삼중 출력 분포에 대한 발산 분석을 통해 더 날카운 수치 경계를 가능하게 한다.
Recent work of Erlingsson, Feldman, Mironov, Raghunathan, Talwar, and Thakurta [EFMRTT19] demonstrates that random shuffling amplifies differential privacy guarantees of locally randomized data. Such amplification implies substantially stronger privacy guarantees for systems in which data is contributed anonymously [BEMMRLRKTS17] and has lead to significant interest in the shuffle model of privacy [CSUZZ19; EFMRTT19]. We show that random shuffling of $n$ data records that are input to $\varepsilon_0$-differentially private local randomizers results in an $(O((1-e^{-\varepsilon_0})\sqrt{\frac{e^{\varepsilon_0}\log(1/δ)}{n}}), δ)$-differentially private algorithm. This significantly improves over previous work and achieves the asymptotically optimal dependence in $\varepsilon_0$. Our result is based on a new approach that is simpler than previous work and extends to approximate differential privacy with nearly the same guarantees. Importantly, our work also yields an algorithm for deriving tighter bounds on the resulting $\varepsilon$ and $δ$ as well as Rényi differential privacy guarantees. We show numerically that our algorithm gets to within a small constant factor of the optimal bound. As a direct corollary of our analysis we derive a simple and nearly optimal algorithm for frequency estimation in the shuffle model of privacy. We also observe that our result implies the first asymptotically optimal privacy analysis of noisy stochastic gradient descent that applies to sampling without replacement.
연구 동기 및 목표
- 이전의 차분 모델에서의 비밀유지 강화 분석에서 국소 개인 정보 보호 파라미터 ${\varepsilon}_0$ 에 대한 비최적의 의존도 문제를 해결하기 위해, 특히 ${\varepsilon}_0 > 1$ 일 때의 상황을 다루는 것.
- 이전 연구에서 더 약한 보장을 제공했던 약간의 차분적 개인 정보 보호를 갖는 국소 랜덤라이저로의 분석 확장을 위한 것.
- 이전의 복잡한 분석에 비해 더 단순화된 증명 기법을 제공하여 더 넓은 적용 가능성과 더 쉬운 구현을 가능하게 하는 것.
- 레니 지아 개인 정보 보호를 포함한 더 날카운 수치 경계를 계산하기 위한 수치적으로 효율적인 방법을 제공하는 것.
- 차분 모델에서 빈도 추정에 대해 거의 최적의 알고리즘을 유도하고, 노이즈가 섞인 확률적 경사 하강법의 개인 정보 보호 분석을 향상시키는 것.
제안 방법
- 핵심 접근법은 적응형 국소 알고리즘의 개인 정보 보호 분석을 비적응형 삼중 출력 국소 랜덤라이저로 환원하는 것으로, '클론'이라는 아이디어를 활용한다. 클론은 기준 출력과 통계적으로 구분되지 않는 출력을 의미한다.
- ${\varepsilon}_0 > 1$ 일 경우, 클론의 이항분포를 이용해 개인 정보 손실을 경계하며, 데이터 포인트가 무작위 수의 클론 중에서 숨겨져 있어야 한다는 점을 보여준다.
- 작은 ${\varepsilon}_0$ 의 경우, 두 입력에 대한 임의의 국소 랜덤라이저가 이진 랜덤라이저 응답과 후처리로 분해될 수 있음을 활용하여 더 날카운 경계를 확보한다.
- 이 방법은 세 결과에 대한 다항분포 간의 레니 발산을 분석하여 개인 정보 보호 경계를 계산하며, 이는 수치적으로 날카운 경계를 가능하게 한다.
- 이 프레임워크는 약간의 차분적 개인 정보 보호 및 레니 지아 개인 정보 보호로 확장되며, 직접 발산 평가를 통한 수치 계산이 가능하다.
- 이 방법은 구현되어 오픈소스로 공개되었으며, 최소한의 오버헤드로 비밀유지 강화 경계를 실용적으로 계산할 수 있도록 한다.
실험 결과
연구 질문
- RQ1차분 모델에서의 비밀유지 강화를 더 단순한 증명으로 분석할 수 있을까? 이는 점근적으로 최적의 ${\varepsilon}_0$ 의존도를 달성할 수 있는가?
- RQ2이 분석은 약간의 차분적 개인 정보 보호를 갖는 국소 랜덤라이저로 확장되어 더 나은 경계를 제공할 수 있는가?
- RQ3이 방법은 기존의 폐쇄형 표현식보다 더 날카운 수치 경계를 도출할 수 있는가?
- RQ4이 방법은 차분 모델에서 거의 최적의 빈도 추정을 도출할 수 있는가?
- RQ5이 프레임워크는 노이즈가 섞인 확률적 경사 하강법과 같은 복합 알고리즘의 더 날카운 개인 정보 보호 보장을 도출하는 데 사용될 수 있는가?
주요 결과
- 논문은 $(O((1-e^{-{\varepsilon}_0})\sqrt{e^{{\varepsilon}_0}\log(1/{\delta})/n}}, \delta)$-차분적 개인 정보 보호 알고리즘을 달성하였으며, 이는 ${\varepsilon}_0 > 1$ 영역에서 최적의 $e^{{\varepsilon}_0/2}$ 의존도와 점점 더 일치한다.
- 약간의 차분적 개인 정보 보호의 경우, 의존도를 $e^{20{\varepsilon}_0}$ 에서 $e^{{\varepsilon}_0/2}$ 로 향상시켜, 이진 랜덤라이저 응답에 대해 알려진 최고의 경계와 일치시킨다.
- 삼중 결과에 대한 발산 분석을 통한 수치 경계는 최적 경계의 작은 상수 배수 이내이며, 이는 이전의 최첨단 기술보다 크게 향상된 것이다.
- 이 방법은 복합 알고리즘의 더 날카운 개인 정보 보호 보장을 가능하게 하며, 고도의 복합성과 함께 사용할 경우, 이전의 RDP 기반 방법보다 훨씬 더 나은 약간의 차분적 개인 정보 보호 경계를 도출한다.
- 이 방법은 개인 정보 보호 강화 경계를 계산하는 데 있어 단순하고 효율적인 알고리즘을 제공하며, 코드는 공개되어 있으며 https://github.com/apple/ml-shuffling-amplification 에서 이용할 수 있다.
- 분석은 적응형 및 비적응형 국소 랜덤라이저 모두에 적용되며, 레니 지아 개인 정보 보호로 확장되며, 레니 지아 개인 정보 보호 순서 전반에 걸쳐 거의 최적의 성능을 보이는 수치 결과를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.