Skip to main content
QUICK REVIEW

[논문 리뷰] Asymptotically optimal private estimation under mean square loss

Min Ye, Alexander Barg|arXiv (Cornell University)|2017. 07. 31.
Privacy-Preserving Technologies in Data참고 문헌 16인용 수 10
한 줄 요약

이 논문은 국소적 차별적 프라이버시 하에서 이산 분포에 대한 개인 정보 보호된 비공식 추정 기법의 渐近 최적성(Asymptotic Optimality)을 확립한다. 가우시안 근사와 피셔 정보 행렬 분석을 활용하여, 제안된 기법의 최악의 평균 제곱 추정 손실이 표본 수가 증가함에 따라 이론적 최적값으로 수렴함을 증명하며, 이는 이전의 순서 최적 경계에서 존재하던 상수 배수 갭을 제거한다.

ABSTRACT

We consider the minimax estimation problem of a discrete distribution with support size $k$ under locally differential privacy constraints. A privatization scheme is applied to each raw sample independently, and we need to estimate the distribution of the raw samples from the privatized samples. A positive number $ε$ measures the privacy level of a privatization scheme. In our previous work (arXiv:1702.00610), we proposed a family of new privatization schemes and the corresponding estimator. We also proved that our scheme and estimator are order optimal in the regime $e^ε \ll k$ under both $\ell_2^2$ and $\ell_1$ loss. In other words, for a large number of samples the worst-case estimation loss of our scheme was shown to differ from the optimal value by at most a constant factor. In this paper, we eliminate this gap by showing asymptotic optimality of the proposed scheme and estimator under the $\ell_2^2$ (mean square) loss. More precisely, we show that for any $k$ and $ε,$ the ratio between the worst-case estimation loss of our scheme and the optimal value approaches $1$ as the number of samples tends to infinity.

연구 동기 및 목표

  • 기존의 순서 최적 개인 정보 보호 추정 기법과 평균 제곱 손실 하에서 이론적 최소 최대 하한 사이의 갭을 해소하기 위해.
  • 모든 k 및 ε 값에 대해 n → ∞ 일 때 최소 최대 개인 정보 보호 추정 손실의 渐近 타이트함을 확립하기 위해.
  • 최악의 추정 손실이 최적 값으로 수렴하는 엄밀한 증명을 제공하여, 이전 결과에서 존재하던 상수 요인 갭을 제거하기 위해.
  • ℓ₂²(평균 제곱) 손실 하에서 이전의 순서 최적성 연구를 전체적인 渐近 최적성으로 확장하기 위해.
  • 엄밀한 대표 표본 분석과 사후 분포의 가우시안 근사를 통해 제안된 비공식화 기법과 추정기의 타당성을 검증하기 위해.

제안 방법

  • e^ε ≪ k 인 영역에서 이전에 순서 최적임이 입증된 비공식화 기법과 해당 추정기의 가족을 제안한다.
  • 사후 분포 분석을 단순화하기 위해 출력 알파벳 축소를 적용한다.
  • 대표 표본 영역에서 추정 오차 분포를 모델링하기 위해 사후 밀도 f_{U|Yⁿ}의 가우시안 근사를 사용한다.
  • 국소 점근 정규성(LAN) 이론에 기반하여 로그우도비율을 피셔 정보 행렬 I(1/k, ..., 1/k)와 연결한다.
  • 피셔 정보 행렬을 포함하는 이차형식으로 로그우도비율 g(u, yⁿ)의 균일한 근사를 확립하여 정확한 손실 특성 분석을 가능하게 한다.
  • 사후 분산 분석과 δ ≥ δ₀ 및 δ < δ₀ 인 경우에 대한 대규모 편차 이론을 활용하여 최소 최대 추정 손실에 대한 점차적으로 타이트한 하한을 유도한다.

실험 결과

연구 질문

  • RQ1표본 수가 무한히 증가할 때, 제안된 비공식화 기법이 최소 최대 평균 제곱 추정 손실에서 渐近 최적성을 달성하는가?
  • RQ2모든 k 및 ε 에 대해 기법의 최악의 추정 손실이 이론적 하한으로 수렴하는가를 입증할 수 있는가?
  • RQ3국소적 차별적 프라이버시 하에서 사후 분포의 점근적 행동을 기술하는 데 있어 피셔 정보 행렬의 역할은 무엇인가?
  • RQ4대표 표본 영역에서 추정 오차의 사후 분포를 가우시안 모델로 어떻게 근사할 수 있는가?
  • RQ5이전의 순서 최적 경계와 진정한 최소 최대 손실 사이의 상수 요인 갭이 점차적으로 제거되는가?

주요 결과

  • 표본 수 n 이 무한히 증가함에 따라 제안된 기법의 최악의 추정 손실과 최적 값 사이의 비율이 1에 수렴함을 입증하여 渐近 최적성을 확인한다.
  • 제안된 비공식화 기법과 추정기는 e^ε ≪ k 영역에 국한되지 않고, 모든 k 및 ε 값에 대해 최소 최대 평균 제곱 손실에서 점차적으로 타이트함을 확보한다.
  • 피셔 정보 행렬 I(1/k, ..., 1/k) 가 사후 분포의 가우시안 근사에서 이차항을 지배하는 행렬 Φ(n, Q) 와 동일함을 입증한다.
  • 로그우도비율 g(u, yⁿ) 는 점차적으로 스코어 함수와 피셔 정보 행렬을 포함하는 이차형식으로 근사되며, 국소 점근 정규성을 확인한다.
  • 모든 분포에 걸쳐 추정 오차에 대한 균일한 경계를 확립하였으며, 오차 분포가 진짜 매개변수 중심, 피셔 정보 행렬의 역행렬을 공분산으로 하는 가우시안로 수렴함을 확인한다.
  • 이 연구에서 도출된 점차적 하한은 타이트하며, 이는 한계에서 실제 최악의 손실과 일치함을 의미하며, 이는 오랫동안 존재하던 이전의 순서 최적 경계에서의 갭을 해결한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.