Skip to main content
QUICK REVIEW

[논문 리뷰] Optimal Algorithms for Mean Estimation under Local Differential Privacy

Hilal Asi, Vitaly Feldman|arXiv (Cornell University)|2022. 05. 05.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

이 논문은 최적화된 파arameter를 가진 PrivUnit이 국소적 차별적 프라이버시 하에서 평균 추정에 대해 가능한 최소 분산을 달성함을 입증하며, 비상호작용이고 불편성 있는 프rotocol의 광범위한 클래스 내에서 최적임을 증명한다. 또한 정규분포 기반의 변종인 PrivUnitG를 도입하여 최적 오차 상수의 정확한 분석 계산을 가능하게 하고, $ \varepsilon \to \infty $ 일 때 점점 $ C^* \approx 0.614 $ 에 수렴하는 점근적 최적 상수를 확인한다. 결과는 국소 랜덤라이저에 대해 대칭화 및 선형 프로그래밍 기법을 통해 유도되었다.

ABSTRACT

We study the problem of mean estimation of $\ell_2$-bounded vectors under the constraint of local differential privacy. While the literature has a variety of algorithms that achieve the asymptotically optimal rates for this problem, the performance of these algorithms in practice can vary significantly due to varying (and often large) hidden constants. In this work, we investigate the question of designing the protocol with the smallest variance. We show that PrivUnit (Bhowmick et al. 2018) with optimized parameters achieves the optimal variance among a large family of locally private randomizers. To prove this result, we establish some properties of local randomizers, and use symmetrization arguments that allow us to write the optimal randomizer as the optimizer of a certain linear program. These structural results, which should extend to other problems, then allow us to show that the optimal randomizer belongs to the PrivUnit family. We also develop a new variant of PrivUnit based on the Gaussian distribution which is more amenable to mathematical analysis and enjoys the same optimality guarantees. This allows us to establish several useful properties on the exact constants of the optimal error as well as to numerically estimate these constants.

연구 동기 및 목표

  • 국소적 차별적 프라이버시 하에서 평균 추정에 대해 분산을 최소화하는 프로토콜을 특정하는 것, 특히 점근적 오차 비율에서 숨겨진 상수를 최소화하는 데 중점을 두는 것.
  • 대칭화 및 선형 프로그래밍을 통한 최적 국소 랜덤라이저의 구조를 규명하여 정확한 최적성 증명을 가능하게 하는 것.
  • 최적성 보장을 유지하면서도 정확한 수학적 분석이 가능한 정규분포 기반의 새로운 알고리즘 PrivUnitG를 개발하는 것.
  • 특히 고차원 설정에서 최적 오차 상수의 수치적 및 분석적 추정을 수행하는 것.
  • 최적 오차 상수가 $ \varepsilon \to \infty $ 일 때 $ C^* \approx 0.614 $ 로 수렴함을 보이며, 실용적 구현에 대한 기준을 제공하는 것.

제안 방법

  • 저자들은 비상호작용적이며 불편성 있는 프로토콜의 클래스를 정의하고, 최악의 경우 평균 제곱오차를 분석하며, 최적화 문제를 선형 프로그램으로 줄이기 위해 대칭화를 사용한다.
  • 최적 랜덤라이저가 특정한 대칭성 및 불변성 성질을 만족해야 한다는 것을 증명하며, 이는 확률 분포 위의 제약 조건이 있는 최적화 문제로 문제를 표현할 수 있음을 의미한다.
  • 최적 랜덤라이저의 구조를 분석함으로써, 이가 PrivUnit 가족에 속함을 보여주며, 이로써 최적화된 파arameter를 가진 PrivUnit이 이 클래스 내에서 최적임을 증명한다.
  • 정규분포를 기반으로 한 변종인 PrivUnitG를 도입하여 분석을 단순화하고, 차원에 독립적인 파arameter화 덕분에 오차 상수의 정확한 계산이 가능해진다.
  • PrivUnitG와 PrivUnit 간 오차 상수의 비율에 대한 경계를 유도하며, $ d \to \infty $ 일 때 이들이 점점 동일해짐을 보여준다.
  • 정규분포 및 구형 랜덤 변수의 농도 부등식과 尾확률 경계를 분석하여 PrivUnit과 PrivUnitG의 성능을 비교하며, $ \sqrt{\mathsf{Err}_G / \mathsf{Err}_2} \leq 1 + O\left(\sqrt{\frac{\varepsilon + \log d}{d}}\right) $ 를 확립한다.

실험 결과

연구 질문

  • RQ1국소적 차별적 프라이버시 하에서 $ \varepsilon $-국소적 차별적 프라이버시를 만족하는 평균 추정에 대해 최적의 국소 랜덤라이저는 무엇이며, 이를 명시적으로 특성화할 수 있는가?
  • RQ2최적화된 파arameter를 가진 PrivUnit은 국소 프라이버시 모델 내에서 모든 비상호작용적이고 불편성 있는 프로토콜 중 가능한 최소 분산을 달성하는가?
  • RQ3정규분포를 기반으로 한 PrivUnit의 변종은 PrivUnit과 동일한 점근적 오차를 달성할 수 있으며, 동시에 오차 상수의 정확한 분석 계산이 가능한가?
  • RQ4비밀유지 파arameter $ \varepsilon \to \infty $ 이고 차원 $ d \to \infty $ 일 때 최적 오차 상수는 어떻게 행동하는가?
  • RQ5최적 오차 상수 $ C^* $ 의 한계 값은 무엇이며, 상수 $ C_{\varepsilon,d} $ 는 얼마나 빨리 이 값으로 수렴하는가?

주요 결과

  • 최적화된 파arameter를 가진 PrivUnit은 $ \varepsilon $-국소적 차별적 프라이버시 하에서 평균 추정에 대해 가능한 최소 분산을 달성하며, 국소 프라이버시 랜덤라이저의 광범위한 가족 내에서 최적임을 입증한다.
  • 대칭화 및 최적화 문제의 선형 프로그래밍 재구성에 의해 증명된 바로, 최적 랜덤라이저는 PrivUnit 가족에 속한다.
  • 정규분포 기반의 변종인 PrivUnitG는 $ d \to \infty $ 일 때 PrivUnit과 동일한 점근적 오차를 $ (1+o(1)) $ 요소로 달성하며, 오차 상수의 정확한 분석을 가능하게 한다.
  • 최적 오차 상수 $ C_{\varepsilon,d} $ 는 $ d \to \infty $ 일 때 $ C_{\varepsilon} $ 로 수렴하며, 수렴 속도는 $ O\left(\frac{\varepsilon + \log d}{d}\right) $ 이다.
  • 한계 상수 $ C^* = \lim_{\varepsilon \to \infty} C_{\varepsilon} $ 는 존재하며 약 $ 0.614 $ 로 추정되며, 고비밀리티 환경에서 가능한 최고의 오차 기준을 제공한다.
  • PrivUnitG와 PrivUnit 간 오차 상수의 비율은 $ 1 + O\left(\sqrt{\frac{\varepsilon + \log d}{d}}\right) $ 으로 경계지며, 이는 두 상수가 점점 동일해짐을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.