Skip to main content
QUICK REVIEW

[논문 리뷰] Propose, Test, Release: Differentially private estimation with high probability

Victor-Emmanuel Brunel, Marco Avella-Medina|arXiv (Cornell University)|2020. 02. 19.
Privacy-Preserving Technologies in Data참고 문헌 28인용 수 13
한 줄 요약

이 논문은 중앙값과 평균의 비차별적 정규화 추정을 위한 개선된 '제안, 검증, 배포'(PTR) 메커니즘을 소개한다. 이 메커니즘은 데이터가 유계이거나 알려진 매개변수 구간이 없더라도, 하위가우시안(high-probability) 오차 경계를 달성한다. 일반적인 모멘트 조건 하에서, 무거운 尾(heavy-tailed) 분포에 대해서도 비차별적 중앙값 및 평균 추정기의 첫 번째 하위가우시안 분산 보장을 제공한다.

ABSTRACT

We derive concentration inequalities for differentially private median and mean estimators building on the "Propose, Test, Release" (PTR) mechanism introduced by Dwork and Lei (2009). We introduce a new general version of the PTR mechanism that allows us to derive high probability error bounds for differentially private estimators. Our algorithms provide the first statistical guarantees for differentially private estimation of the median and mean without any boundedness assumptions on the data, and without assuming that the target population parameter lies in some known bounded interval. Our procedures do not rely on any truncation of the data and provide the first sub-Gaussian high probability bounds for differentially private median and mean estimation, for possibly heavy tailed random variables.

연구 동기 및 목표

  • 유계 데이터나 알려진 매개변수 범위가 없는 상황에서 비차별적 중앙값 및 평균 추정기의 고도의 확률적 오차 경계 부족 문제를 해결한다.
  • 기존 비차별적 추정기가 데이터 절단 또는 매개변수 범위에 대한 사전 지식을 필요로 하는 한계를 극복한다.
  • 무거운 尾 분포를 포함한 최소한의 모멘트 가정 하에서 비차별적 평균 및 중앙값 추정의 하위가우시안 분산 보장을 제공한다.
  • 실패 확률을 통제하면서 노이즈를 최소화하는 일반적이고 날카운 기반의 PTR 메커니즘을 개발한다.
  • 최악의 노이즈 캘리브레이션에 의존하지 않는 유한 표본, 고도의 확률적 오차 경계를 확립한다.

제안 방법

  • 데이터 구성에 따라 노이즈를 적응적으로 캘리브레이션하는 일반화되고 개선된 '제안, 검증, 배포'(PTR) 메커니즘을 도입한다.
  • 표본 평균의 중앙값 추정기를 기반으로 하여 데이터를 K개의 상호배타적 블록으로 나눈다.
  • empirical means에 PTR 메커니즘을 적용하여 데이터 구성이 저노이즈 추정을 허용하는지 검증한다.
  • 순서통계량과 균일 간격의 농도 불등식을 사용하여 '응답 없음' 확률을 제어한다.
  • 순서통계량과 균일 간격을 활용하여 중앙값의 표본 평균 주위의 신뢰구간 너비를 제한함으로써 고도의 확률적 정확도를 확보한다.
  • Hoeffding의 부등식과 Bernstein의 부등식을 순서통계량의 농도 경계와 결합하여 하위가우시안 분산 경계를 유도한다.

실험 결과

연구 질문

  • RQ1비차별적 중앙값 및 평균 추정기가 유계 데이터나 알려진 매개변수 범위 없이도 하위가우시안 고도의 확률적 오차 경계를 달성할 수 있는가?
  • RQ2두 번째 모멘트 가정만으로도 비차별적 평균 추정기가 하위가우시안 분산을 유지할 수 있는가?
  • RQ3PTR 메커니즘을 어떻게 개선하여 노이즈를 최소화하면서도 고도의 확률적 정확도와 실패 확률을 통제할 수 있는가?
  • RQ4무거운 尾 분포에 대해 중앙값의 표본 평균 추정기를 비차별적 기반으로 적응시키며 하위가우시안 오차 보장을 달성할 수 있는가?
  • RQ5비차별적 위치 추정에서 노이즈 수준, 실패 확률, 표본 복잡도 사이의 최적의 트레이드오프는 무엇인가?

주요 결과

  • 제안된 PTR 메커니즘은 유계 데이터나 매개변수 위치에 대한 사전 지식 없이도 비차별적 중앙값 및 평균 추정의 하위가우시안 고도의 확률적 오차 경계를 달성한다.
  • 중앙값의 표본 평균 추정기의 경우, 기저 분포가 두 개의 유한 모멘트만을 가진다고 해도 오차가 하위가우시안 임계값을 초과할 확률이 τ 이하로 제한됨을 보장한다.
  • k번째 순서통계량이 제어 가능한 간격 내에 있을 경우, 순서통계량과 균일 간격의 농도 경계를 조합하여 실패 확률을 최대 τ/2 이하로 제어한다.
  • 노이즈 수준은 적응적으로 캘리브레이션된다: 데이터가 유리한 구성일 경우, 낮은 노이즈만 추가되어 최악의 경우 메커니즘보다 정확도가 크게 향상된다.
  • 적절한 고도의 확률 경계를 확보하기 위해 n ≥ 33(ρ/σ)^6K 개의 표본이 필요하며, 여기서 ρ는 첨도(kurtosis)이고 σ는 표준편차이다.
  • 최종 추정기는 평균과 중앙값에 대해 O(√(log(1/τ)/n)) 정도의 하위가우시안 분산 경계를 달성하며, 최소한의 모멘트 가정 하에서 비차별적 하위가우시안 비율을 그대로 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.