Skip to main content
QUICK REVIEW

[논문 리뷰] Estimating Smooth GLM in Non-interactive Local Differential Privacy Model with Public Unlabeled Data

Di Wang, Lijie Hu|arXiv (Cornell University)|2019. 10. 01.
Privacy-Preserving Technologies in Data참고 문헌 44인용 수 13
한 줄 요약

이 논문은 공개된 레이블이 없는 데이터를 활용하여 비공식적 국소적 차별적 프라이버시(NLDP) 모델 하에서 부드러운 일반선형모형(GLM)을 효율적으로 추정하기 위한 알고리즘을 제안한다. 스텐의 보조정리의 변종을 사용함으로써, 저자들은 다항식 표본 복잡도를 달성한다—구체적으로, 비공개 데이터에 대해 $ ilde{O}(p^3eta^{-2} ho^{-2})$이고, 공개 데이터에 대해 $O(peta^{-2})$이며, 이는 이전의 지수적 또는 준다항식 복잡도에 비해 극적으로 향상된 결과이다.

ABSTRACT

In this paper, we study the problem of estimating smooth Generalized Linear Models (GLMs) in the Non-interactive Local Differential Privacy (NLDP) model. Different from its classical setting, our model allows the server to access some additional public but unlabeled data. In the first part of the paper we focus on GLMs. Specifically, we first consider the case where each data record is i.i.d. sampled from a zero-mean multivariate Gaussian distribution. Motivated by the Stein's lemma, we present an $(ε, δ)$-NLDP algorithm for GLMs. Moreover, the sample complexity of public and private data for the algorithm to achieve an $\ell_2$-norm estimation error of $α$ (with high probability) is ${O}(p α^{-2})$ and $ ilde{O}(p^3α^{-2}ε^{-2})$ respectively, where $p$ is the dimension of the feature vector. This is a significant improvement over the previously known exponential or quasi-polynomial in $α^{-1}$, or exponential in $p$ sample complexities of GLMs with no public data. Then we consider a more general setting where each data record is i.i.d. sampled from some sub-Gaussian distribution with bounded $\ell_1$-norm. Based on a variant of Stein's lemma, we propose an $(ε, δ)$-NLDP algorithm for GLMs whose sample complexity of public and private data to achieve an $\ell_\infty$-norm estimation error of $α$ is ${O}(p^2α^{-2})$ and $ ilde{O}(p^2α^{-2}ε^{-2})$ respectively, under some mild assumptions and if $α$ is not too small ({\em i.e.,} $α\geq Ω(\frac{1}{\sqrt{p}})$). In the second part of the paper, we extend our idea to the problem of estimating non-linear regressions and show similar results as in GLMs for both multivariate Gaussian and sub-Gaussian cases. Finally, we demonstrate the effectiveness of our algorithms through experiments on both synthetic and real-world datasets.

연구 동기 및 목표

  • 기존 방법이 지수적 표본 복잡도를 보이는 비공식적 국소적 차별적 프라이버시(NLDP) 환경에서 GLM 추정의 과제를 해결한다.
  • 정확한 추정을 위해 준다항식 또는 지수적 표본 크기를 요구하는 기존 NLDP 접근법의 한계를 극복한다.
  • 비공개 데이터의 표본 복잡도를 크게 줄이기 위해 공개된 레이블이 없는 데이터를 활용한다.
  • 유사한 효율성 보장을 갖는 비선형 회귀 모델로 제안된 프레임워크를 확장한다.
  • 실제 및 시뮬레이션 데이터 세트에서 알고리즘의 실용적 효과를 입증한다.

제안 방법

  • 스텐의 보조정리의 변종을 기반으로 한 $(\rho,\delta)$-NLDP 알고리즘을 제안하여, 프라이버시 제약 하에서도 효율적인 추정을 가능하게 한다.
  • 공개된 레이블이 없는 데이터를 사용하여 특성 분포의 공분산 행렬을 추정하며, 이는 정확한 GLM 파라미터 추정에 핵심적이다.
  • 국소적 차별적 프라이버시를 보장하기 위해, 프라이버시 보존 노이즈를 도입한 스무드한 경험 위험 최소화 방법을 적용한다.
  • 서브가우시안 및 가우시안 가정 하에서 $\ell_2$ 및 $\ell_\infty$ 추정 오차를 분석함으로써 표본 복잡도에 대한 이론적 경계를 유도한다.
  • 로지스틱, 시그모이드, 세차 함수 등 다양한 링크 함수를 위해 스텐 기반 추정 프레임워크를 적응시켜 별도의 알고리즘을 설계한다.
  • 공개 데이터를 추정 과정에 통합함으로써 비공개 데이터에 대한 의존도를 줄이고, 프라이버시 보장을 유지한다.

실험 결과

연구 질문

  • RQ1공개된 레이블이 없는 데이터는 NLDP 모델에서 GLM 추정의 표본 복잡도를 효과적으로 줄일 수 있는가?
  • RQ2공개 데이터가 이용 가능한 상황에서 NLDP 하에서 GLM을 추정할 때의 이론적 표본 복잡도는 무엇인가?
  • RQ3스텐의 보조정리 기반으로 제안된 방법은 이전의 지수적 또는 준다항식 표본 복잡도를 보이는 NLDP 접근법에 비해 어떻게 향상되는가?
  • RQ4이 프레임워크는 비슷한 효율성과 프라이버시 보장을 갖는 비선형 회귀 모델로 확장될 수 있는가?
  • RQ5다양한 프라이버시 및 데이터 크기 제약 조건 하에서 실제 및 시뮬레이션 데이터 세트에서 제안된 알고리즘의 경험적 성능은 어떠한가?

주요 결과

  • 제안된 알고리즘은 $\ell_2$-노름 추정 오차를 $\beta$로 유지하면서 공개 데이터 $O(p\beta^{-2})$와 비공개 데이터 $ ilde{O}(p^3\beta^{-2}\rho^{-2})$를 요구하며, 이는 이전의 지수적 또는 준다항식 경계에 비해 극적으로 향상된 결과이다.
  • 유한한 $\ell_1$-노름을 갖는 서브가우시안 데이터의 경우, $\ell_\infty$-노름 오차를 $\beta$로 유지하기 위해 공개 데이터 $O(p^2\beta^{-2})$와 비공개 데이터 $ ilde{O}(p^2\beta^{-2}\rho^{-2})$가 필요하며, 약간의 가정 하에 $\beta \geq \Omega(1/\sqrt{p})$ 조건을 만족할 때 성립한다.
  • 프레임워크는 지수, 로지스틱, 세차 링크 함수를 포함한 비선형 회귀 모델로 성공적으로 확장되었으며, 유사한 표본 복잡도 보장을 갖는다.
  • 시뮬레이션 및 실제 데이터 세트(예: Covertype, SUSY, Skin Segmentation)에 대한 실험 결과, 알고리즘이 낮은 상대 오차를 기록하고 공개 데이터 크기가 증가함에 따라 잘 스케일링됨을 보였다.
  • 비교 평가를 통해 기존의 2라운드 LDP 알고리즘에 비해 추정 정확도와 표본 효율성 면에서 제안된 방법이 뛰어난 성능을 보였다.
  • 공개 데이터의 사용은 필요한 비공개 데이터의 양을 상당히 줄여, 민감한 데이터를 포함한 실세계 응용에 실용적인 접근을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.