[논문 리뷰] Private Robust Estimation by Stabilizing Convex Relaxations
이 논문은 적대적 이상치가 존재하는 상황에서 평균, 공분산, 그리고 고차원 모멘트의 강건한 추정을 위한 첫 번째 다항시간 및 표본 $(\varepsilon,\delta)$-차별적 개인정보 보호 알고리즘을 제시한다. 이는 증거를 생성하는 강건한 추정기와 추정값에 의존하는 노이즈 주입을 통해 볼록 이완을 안정화하는 새로운 프레임워크를 활용한다. 이 알고리즘은 증명 가능하고 하위가우시안성 및 초수렴성 조건 하에서 아핀 불변 보장(마할라노비스, 스펙트럼, 프로베니우스 노름)을 달성하며, 일반적인 분포 가정 하에 최적의 표본 복잡도와 개인정보 보호 성능을 확보한다.
We give the first polynomial time and sample $(ε, δ)$-differentially private (DP) algorithm to estimate the mean, covariance and higher moments in the presence of a constant fraction of adversarial outliers. Our algorithm succeeds for families of distributions that satisfy two well-studied properties in prior works on robust estimation: certifiable subgaussianity of directional moments and certifiable hypercontractivity of degree 2 polynomials. Our recovery guarantees hold in the "right affine-invariant norms": Mahalanobis distance for mean, multiplicative spectral and relative Frobenius distance guarantees for covariance and injective norms for higher moments. Prior works obtained private robust algorithms for mean estimation of subgaussian distributions with bounded covariance. For covariance estimation, ours is the first efficient algorithm (even in the absence of outliers) that succeeds without any condition-number assumptions. Our algorithms arise from a new framework that provides a general blueprint for modifying convex relaxations for robust estimation to satisfy strong worst-case stability guarantees in the appropriate parameter norms whenever the algorithms produce witnesses of correctness in their run. We verify such guarantees for a modification of standard sum-of-squares (SoS) semidefinite programming relaxations for robust estimation. Our privacy guarantees are obtained by combining stability guarantees with a new "estimate dependent" noise injection mechanism in which noise scales with the eigenvalues of the estimated covariance. We believe this framework will be useful more generally in obtaining DP counterparts of robust estimators. Independently of our work, Ashtiani and Liaw [AL21] also obtained a polynomial time and sample private robust estimation algorithm for Gaussian distributions.
연구 동기 및 목표
- 고차원 평균과 공분산에 대한 차별적 개인정보 보호 강건 추정 알고리즘을 설계하여, 일정 비율의 적대적 이상치를 수용한다.
- 유계 지지 또는 조건수 가정을 초월해 비밀유지 추정을 일반 하위가우시안 및 초수렴성 분포에 대해 확장한다.
- 어떤 증거 생성이 가능하고 효율적으로 해결 가능한 강건 추정 알고리즘을, 강력한 안정성 및 유효성 보장이 보장된 차별적 개인정보 보호 변형으로 전환하는 일반적 프레임워크를 개발한다.
- 알 수 없는 분포의 조건수를 사전에 알지 못해도, 스펙트럼 및 상대 프로베니우스 오차 한계를 다항적 형태로 확보한다 — 이는 데이터 화이트닝 및 총 변동 근사화에 필수적이다.
제안 방법
- 알고리즘이 정당한 증거를 생성할 경우, 매개변수 노름에서 최악의 경우 안정성을 확보함으로써 강건 추정을 위한 볼록 이완(특히, 제곱합(SoS) SDP 이완)을 안정화한다.
- 노이즈가 추정값에 따라 조절되는 새로운 '추정값 기반' 노이즈 주입 메커니즘을 도입하여, 공분산 행렬의 고유값에 비례하게 노이즈를 조절함으로써 강력한 개인정보 보호 보장을 달성한다.
- 손상된 데이터에 대해 강건한 가중치를 계산하기 위해 수정된 제곱합(SoS) 준선형계획법 이완을 사용하며, 이는 증명 가능 하위가우시안 또는 초수렴성 성질을 갖는 분포를 생성한다.
- 단일 점 변경에 따른 평균과 공분산의 변동을 제한하기 위해 잠재 함수를 통해 안정성을 강제하며, 이론적 보장은 증명 가능 하위가우시안성 및 초수렴성 제약 조건에서 유도된다.
- 최종 추정치에 노이즈를 추가한다: $\hat{\mu} = \widetilde{\mu} + \widetilde{\Sigma}^{1/2}z$ 와 $\hat{\Sigma} = \widetilde{\Sigma} + \widetilde{\Sigma}^{1/2}Z\widetilde{\Sigma}^{1/2}$, 여기서 $z$ 와 $Z$ 는 분산이 $\gamma_1, \gamma_2$ 에 비례하게 조절되는 가우시안 분포를 따른다. 이는 데이터와 개인정보 보호 매개변수에 따라 결정된다.
- 이론적 분석은 안정성 한계와 차별적 개인정보 보호를 통합하여, 출력이 마할라노비스, 스펙트럼, 프로베니우스 노름에서 $\varepsilon$-차별적 개인정보 보호 및 유효성 보장을 만족함을 증명한다.
실험 결과
연구 질문
- RQ1일정 비율의 적대적 이상치가 존재하는 상황에서, 유계 지지나 조건수 가정 없이도 고차원 평균과 공분산에 대해 차별적 개인정보 보호 강건 추정기를 설계할 수 있는가?
- RQ2단일 점 변화에 대한 최악의 경우 매개변수 안정성을 확보하기 위해 강건 추정을 위한 볼록 이완을 어떻게 안정화할 수 있는가? 이는 개인정보 보호 보장을 가능하게 한다.
- RQ3강력한 다항 오차 보장을 갖는 효율적 비밀유지 강건 추정을 가능하게 하는 최소한의 분포 가정(예: 증명 가능 하위가우시안성, 초수렴성)은 무엇인가?
- RQ4알 수 없는 분포의 공분산 구조를 사전에 알지 못해도, 아핀 불변 오차 한계(예: 마할라노비스, 스펙트럼, 프로베니우스)를 비밀유지 강건 추정에서 달성할 수 있는가?
- RQ5모든 증거 생성이 가능하고 효율적으로 해결 가능한 강건 추정기의 변형을, 유사한 유효성 보장을 갖는 차별적 개인정보 보호 변형으로 전환할 수 있는 일반적 프레임워크를 설계할 수 있는가?
주요 결과
- 알고리즘은 평균에 대해 마할라노비스 노름에서 $O(\sqrt{C} \eta^{3/4})$ 오차, 공분산에 대해 상대 프로베니우스 노름에서 $O(C \sqrt{\eta})$ 오차를 달성한다. 여기서 $C$ 는 하위가우시안성 및 초수렴성 매개변수를 캡처하며, $\eta$ 는 이상치 비율이다.
- 표본 복잡도는 $\widetilde{\Omega}\left(\frac{d^8}{\eta^2} \left(1 + \frac{\ln(1/\delta)}{\varepsilon}\right)^4 C^4\right)$ 로, 차원과 이상치 비율의 역수에 대해 다항식이며, 개인정보 보호 매개변수에 대해 로그적 의존성을 갖는다.
- 이 알고리즘은 알려진 공분산에 대한 조건수 가정 없이도, 이상치가 없는 경우조차도 비밀유지 강건 공분산 추정을 제공하는 최초의 알고리즘이다.
- 프레임워크는 새로운 추정값 기반 노이즈 주입 메커니즘을 통해 개인정보 보장을 가능하게 하며, 이는 공분산의 고유값에 비례하게 노이즈가 조절되어 강력한 차별적 개인정보 보장을 보장한다.
- 이 방법은 증명 가능 하위가우시안성 및 초수렴성 조건 하에서 아핀 불변 노름(화이트닝 및 총 변동 근사화에 필수적임)에서 유효성 보장을 달성한다.
- 알고리즘은 최소 $9/10$ 확률로 성공하며, $(\varepsilon,\delta)$-차별적 개인정보 보호를 만족하며, 비트 복잡도와 입력 크기의 다항식 시간 내에 실행된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.