[论文解读] Private Robust Estimation by Stabilizing Convex Relaxations
该论文提出了首个在对抗性异常值下对均值、协方差及高阶矩进行鲁棒估计的多项式时间与样本复杂度的 $(\varepsilon,\delta)$-差分隐私算法,其核心是通过生成见证的鲁棒估计器和与估计值相关的噪声注入,稳定凸松弛化的新框架。该方法在可验证的次高斯性和超可积性条件下,实现了仿射不变的保证(马氏距离、谱范数与弗罗贝尼乌斯范数),在一般分布假设下达到最优样本复杂度与隐私保护性能。
We give the first polynomial time and sample $(ε, δ)$-differentially private (DP) algorithm to estimate the mean, covariance and higher moments in the presence of a constant fraction of adversarial outliers. Our algorithm succeeds for families of distributions that satisfy two well-studied properties in prior works on robust estimation: certifiable subgaussianity of directional moments and certifiable hypercontractivity of degree 2 polynomials. Our recovery guarantees hold in the "right affine-invariant norms": Mahalanobis distance for mean, multiplicative spectral and relative Frobenius distance guarantees for covariance and injective norms for higher moments. Prior works obtained private robust algorithms for mean estimation of subgaussian distributions with bounded covariance. For covariance estimation, ours is the first efficient algorithm (even in the absence of outliers) that succeeds without any condition-number assumptions. Our algorithms arise from a new framework that provides a general blueprint for modifying convex relaxations for robust estimation to satisfy strong worst-case stability guarantees in the appropriate parameter norms whenever the algorithms produce witnesses of correctness in their run. We verify such guarantees for a modification of standard sum-of-squares (SoS) semidefinite programming relaxations for robust estimation. Our privacy guarantees are obtained by combining stability guarantees with a new "estimate dependent" noise injection mechanism in which noise scales with the eigenvalues of the estimated covariance. We believe this framework will be useful more generally in obtaining DP counterparts of robust estimators. Independently of our work, Ashtiani and Liaw [AL21] also obtained a polynomial time and sample private robust estimation algorithm for Gaussian distributions.
研究动机与目标
- 设计首个针对高维均值与协方差的差分隐私鲁棒估计算法,可在常数比例对抗性异常值下保持稳健。
- 将隐私估计从有界支撑或条件数假设的限制中解放,实现对一般次高斯与超可积分布的隐私保护鲁棒统计。
- 提出一种通用框架,可将任意生成见证、可高效求解的鲁棒估计算法转化为具有强稳定性和效用保证的差分隐私版本。
- 在无需事先知晓未知分布条件数的前提下,实现乘法谱误差与相对弗罗贝尼乌斯误差界——这对数据白化与总变差近似至关重要。
提出的方法
- 该框架通过确保算法生成有效见证时,在参数范数上对最坏情况下的稳定性进行控制,从而稳定鲁棒估计的凸松弛化(特别是平方和(SoS)半定规划(SDP)松弛化)。
- 提出一种新颖的“与估计值相关的”噪声注入机制,其中噪声的大小与估计协方差矩阵的特征值成比例,从而在差分隐私下实现强隐私保证。
- 算法使用改进的平方和(SoS)半定规划松弛化方法,在污染数据上计算鲁棒权重,生成具有可验证次高斯性或超可积性的分布。
- 通过一个势函数强制实现稳定性,该函数在单点扰动下界定了均值与协方差的扰动,理论保证基于可验证的次高斯性与超可积性约束。
- 在最终估计中加入噪声:$\hat{\mu} = \widetilde{\mu} + \widetilde{\Sigma}^{1/2}z$ 与 $\hat{\Sigma} = \widetilde{\Sigma} + \widetilde{\Sigma}^{1/2}Z\widetilde{\Sigma}^{1/2}$,其中 $z$ 与 $Z$ 为高斯噪声,其方差按 $\gamma_1, \gamma_2$ 缩放,后者依赖于数据与隐私参数。
- 理论分析结合了稳定性界与差分隐私,证明输出满足 $\varepsilon$-差分隐私,并在马氏距离、谱范数与弗罗贝尼乌斯范数下具有效用保证。
实验结果
研究问题
- RQ1我们能否设计一种差分隐私鲁棒估计器,用于高维均值与协方差,在常数比例对抗性异常值下运行,且无需有界支撑或条件数假设?
- RQ2如何稳定鲁棒估计的凸松弛化,以确保在单点扰动下的最坏情况参数稳定性,从而实现隐私保证?
- RQ3在何种最小分布假设集下(如可验证次高斯性、超可积性),可实现高效差分隐私鲁棒估计并具备乘法误差保证?
- RQ4我们能否在无需事先知晓未知分布协方差结构的前提下,实现差分隐私鲁棒估计中的仿射不变误差界(如马氏距离、谱范数、弗罗贝尼乌斯范数)?
- RQ5是否可能设计一种通用框架,将任意生成见证、可高效求解的鲁棒估计器转化为具有可比效用的差分隐私版本?
主要发现
- 该算法在马氏距离范数下对均值的误差为 $O(\sqrt{C} \eta^{3/4})$,在相对弗罗贝尼乌斯范数下对协方差的误差为 $O(C \sqrt{\eta})$,其中 $C$ 捕获了次高斯性与超可积性参数,$\eta$ 为异常值率。
- 样本复杂度为 $\widetilde{\Omega}\left(\frac{d^8}{\eta^2} \left(1 + \frac{\ln(1/\delta)}{\varepsilon}\right)^4 C^4\right)$,在维度与反异常值率上为多项式关系,对隐私参数具有对数依赖性。
- 该算法是首个在未知协方差无任何条件数假设下(甚至在无异常值情况下)实现差分隐私鲁棒协方差估计的算法。
- 该框架通过一种新颖的与估计值相关的噪声注入机制实现隐私保证,其中噪声大小与估计协方差的特征值成比例,确保强差分隐私。
- 该方法在可验证次高斯性与超可积性条件下,实现了仿射不变范数下的效用保证——这对数据预处理(如白化与总变差近似)至关重要。
- 该算法以至少 $9/10$ 的概率成功运行,且满足 $(\varepsilon,\delta)$-差分隐私,其运行时间在位复杂度与输入大小上为多项式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。