Skip to main content
QUICK REVIEW

[논문 리뷰] Differentially private inference via noisy optimization

Marco Avella-Medina, Casey Bradshaw|arXiv (Cornell University)|2021. 03. 19.
Statistical Methods and Inference인용 수 7
한 줄 요약

이 논문은 국소적 강凸성 또는 자기조화 조건 하에서 전역 수렴 보장을 갖는 노이즈가 첨가된 경사 하강법과 노이즈가 첨가된 뉴턴 방법을 사용하여, 비밀성 보장이 보장되는 M-추정량을 계산하기 위한 새로운 비밀성 보장 최적화 프레임워크를 제안한다. 이는 근사 최소최대 최적 추정과 비밀성 보장된 분산 추정을 통해 渐近적으로 타당한 신뢰구역을 가능하게 하며, 편향 보정 방법을 통해 소표본 커버리지 성능을 크게 향상시킨다.

ABSTRACT

We propose a general optimization-based framework for computing differentially private M-estimators and a new method for constructing differentially private confidence regions. Firstly, we show that robust statistics can be used in conjunction with noisy gradient descent or noisy Newton methods in order to obtain optimal private estimators with global linear or quadratic convergence, respectively. We establish local and global convergence guarantees, under both local strong convexity and self-concordance, showing that our private estimators converge with high probability to a small neighborhood of the non-private M-estimators. Secondly, we tackle the problem of parametric inference by constructing differentially private estimators of the asymptotic variance of our private M-estimators. This naturally leads to approximate pivotal statistics for constructing confidence regions and conducting hypothesis testing. We demonstrate the effectiveness of a bias correction that leads to enhanced small-sample empirical performance in simulations. We illustrate the benefits of our methods in several numerical examples.

연구 동기 및 목표

  • 비밀성을 보장하면서 통계적 효율성을 유지하는 일반적인 최적화 기반의 비밀성 보장 M-추정량 프레임워크를 개발하는 것.
  • 국소적 강凸성 하에서 노이즈가 첨가된 경사 하강법의 전역 유한표본 수렴을 확립하여, 근사 최적 이웃으로 선형 수렴을 달성하는 것.
  • 유사한 조건 하에서 고정된 감쇠 단계를 통해 백트래킹을 피하는 비밀성 보장 뉴턴 방법을 제안하는 것.
  • 노이즈가 첨가된 샌드위치 공식을 통해 비밀성 보장된 점근적 분산 추정량을 이용하여 渐近적으로 타당한 신뢰구역을 구성하는 것.
  • 소표본 성능을 향상시키기 위해 새로운 편향 보정 방법을 통해 신뢰구역 커버리지 확률을 향상시키는 것.

제안 방법

  • 각 반복 단계에 비밀성 유도 노이즈를 첨가한 노이즈가 첨가된 경사 하강법을 사용하며, 기울기 클리핑 문제를 피하기 위해 강건한 M-추정량을 활용한다.
  • 각 반복 단계에서 기울기와 헤시안에 노이즈를 주입하여 노이즈가 첨가된 뉴턴 스텝을 적용함으로써 비밀성 보장과 수렴성을 동시에 확보한다.
  • 이중 단계 전략을 활용: 해가 멀리 떨어져 있을 땐 고정된 단계 크기 η < 1을 갖는 감쇠 뉴턴 스텝을 사용하고, 검증 가능한 조건을 만족할 경우 순수 뉴턴(η = 1)으로 전환한다.
  • 행렬 기반 노이즈 메커니즘을 샌드위치 분산 추정량에 적용하여 비밀성 보장된 신뢰구역을 구성함으로써 분산 구성 요소 양쪽의 비밀성 보장 확보.
  • 소표본에서의 커버리지 확률 향상을 위해 비밀성 보장된 분산 추정량에 대한 편향 보정을 도입한다.
  • μ-GDP(Gaussian Differential Privacy)를 사용하여 비밀성 캘리브레이션을 수행하고, 국소적 강凸성 또는 자기조화 조건 가정을 통해 수렴 보장.
Figure 1: Noisy gradient descent trajectories for linear regression. (a) Estimates of a single coordinate of the regression vector. (b) Gradient of the loss function evaluated at the current iterate, plotted on a log scale.
Figure 1: Noisy gradient descent trajectories for linear regression. (a) Estimates of a single coordinate of the regression vector. (b) Gradient of the loss function evaluated at the current iterate, plotted on a log scale.

실험 결과

연구 질문

  • RQ1강건한 M-추정량을 사용하는 노이즈가 첨가된 경사 하강법가 비밀성 보장 하에서 국소적 강凸성 조건 하에 전역 선형 수렴과 근사 최소최대 최적성을 달성할 수 있는가?
  • RQ2기울기와 헤시안 양쪽에 노이즈를 첨가한 비밀성 보장 뉴턴 방법이 이차 수렴을 달성하고 경사 하강법보다 성능 향상을 이룰 수 있는가?
  • RQ3비밀성 보장된 점근적 분산 추정량을 구성하여 비밀성 보장 하에서 渐近적으로 타당한 신뢰구역을 확보할 수 있는가?
  • RQ4제안된 편향 보정 방법이 소표본에서 비밀성 보장된 신뢰구간의 경험적 커버리지 확률을 어떻게 향상시키는가?
  • RQ5비밀성 보장 하에서 강건한 M-추정량이 기울기 클리핑과 목적함수 편향에 비해 추정 오차와 편향 측면에서 어떻게 성능을 발휘하는가?

주요 결과

  • 국소적 강凸성 하에서 강건한 M-추정량을 사용하는 노이즈가 첨가된 경사 하강법는 비밀성 보장 하에서 비밀성 없는 M-추정량의 작은 이웃으로 전역 선형 수렴을 달성하며, 높은 확률로 성립한다.
  • 국소적 강凸성 또는 자기조화 조건 하에서 제안된 노이즈가 첨가된 뉴턴 방법은 근사 최적 해로 이차 수렴을 달성하며, 최적점에서 멀리 떨어져 초기화된 경우 노이즈가 첨가된 경사 하강법보다 뛰어난 성능을 보인다.
  • 비밀성 보장 샌드위치 공식을 사용한 제안된 신뢰구역 구성 방법은 渐近적으로 타당성을 확보하며, 편향 보정을 통해 소표본에서의 커버리지 확률을 크게 향상시킨다.
  • 시뮬레이션 결과, 국소적 강건한 가중치를 사용하는 노이즈가 첨가된 경사 하강법는 기울기 클리핑과 목적함수 편향보다 더 우수한 성능을 보이며, 특히 클리핑이 최소일 경우에 두드러진다.
  • 유한하지 않은 데이터 설정에서는 노이즈가 첨가된 경사 하강법에 강건한 가중치와 매랄로스 가중치를 사용한 목적함수 편향이 유사한 성능을 보이며, 기울기 클리핑은 눈에 띄는 편향을 유발한다.
  • 편향 보정 방법은 특히 저표본 영역에서 신뢰구간의 경험적 커버리지 확률을 크게 향상시키며, 비밀성 보장 조건을 손상시키지 않는다.
Figure 2: (a) Noisy Newton’s method vs. gradient descent. The vertical axis records the norm of the gradient trajectory on a log scale. (b) Divergence of noisy damped Newton. When $\eta=1$ (pure Newton), the algorithm may not converge if the initial point is far from the global optimum $\hat{\theta}
Figure 2: (a) Noisy Newton’s method vs. gradient descent. The vertical axis records the norm of the gradient trajectory on a log scale. (b) Divergence of noisy damped Newton. When $\eta=1$ (pure Newton), the algorithm may not converge if the initial point is far from the global optimum $\hat{\theta}

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.