[论文解读] Differential Privacy with Compression
本文提出一种通过高斯随机矩阵实施随机线性压缩以实现统计数据库差分隐私的方法,支持保留效用的合成数据发布。该方法建立了理论保证,表明压缩后的数据在保持主成分分析(PCA)及其他基于协方差分析的准确性的同时具备隐私保护能力,通过矩阵范数界和测度截断技术量化了隐私与效用之间的权衡。
This work studies formal utility and privacy guarantees for a simple multiplicative database transformation, where the data are compressed by a random linear or affine transformation, reducing the number of data records substantially, while preserving the number of original input variables. We provide an analysis framework inspired by a recent concept known as differential privacy (Dwork 06). Our goal is to show that, despite the general difficulty of achieving the differential privacy guarantee, it is possible to publish synthetic data that are useful for a number of common statistical learning applications. This includes high dimensional sparse regression (Zhou et al. 07), principal component analysis (PCA), and other statistical measures (Liu et al. 06) based on the covariance of the initial data.
研究动机与目标
- 开发一种正式的隐私保护机制,确保主成分分析和高维回归等常见学习任务的统计效用。
- 证明使用独立同分布的高斯矩阵进行随机线性压缩可在保持原始数据经验协方差结构的同时实现差分隐私。
- 建立一个理论框架,将隐私(通过差分隐私和分布隐私)与效用联系起来,尤其在高维低样本量场景下。
- 通过矩阵范数差值的界和测度截断技术,分析隐私、数据维度和压缩率之间的权衡。
- 确立压缩数据可用于下游统计推断且不损害个体隐私的条件。
提出的方法
- 对 $n \times p$ 数据应用随机线性变换 $\mathcal{X} = \Phi X$,其中 $\Phi \sim \mathcal{N}(0,1)^{m \times n}$,将数据压缩为 $m \times p$ 的合成数据,且满足 $m \ll n$。
- 通过测度空间截断和重归一化控制隐私泄露,丢弃每种分布下概率至多为 $1/n^2$ 的事件。
- 通过似然密度比 $f_{\Sigma_1}(\mathcal{X}) / f_{\Sigma_i}(\mathcal{X})$ 定义隐私,利用矩阵范数和协方差偏差项对对数比值进行有界。
- 引入 $\Delta_{\max}(\mathcal{S}_n)$ 作为总体协方差矩阵与样本协方差矩阵之间成对距离的上界,该界由大偏差不等式导出。
- 通过证明 $\alpha(m,\delta)$ 受包含 $m$、$p$、$\|\Delta\|_F$ 及 $\Sigma_i$ 特征值的项有界,且误差为 $o(1)$,建立隐私保证。
- 利用集中不等式和矩阵偏差界控制原始与压缩样本协方差矩阵之间的差异,确保当 $m = \Omega(p^2 \ln(2np))$ 时 $\|B\|_F = o(1)$。
实验结果
研究问题
- RQ1通过独立同分布的高斯矩阵进行随机线性压缩,是否能在保持主成分分析和基于协方差推断的效用的同时实现差分隐私?
- RQ2在高维数据背景下,压缩率 $m$、数据维度 $p$ 与隐私保证之间的权衡关系如何?
- RQ3如何利用测度截断和密度重归一化在不显著降低效用的前提下确保差分隐私?
- RQ4压缩后的数据在多大程度上保留了统计学习任务所需的经验证据协方差结构?
- RQ5在随机投影背景下,能否形式化分布隐私并将其与差分隐私关联起来?
主要发现
- 当 $m = \Omega(p^2 \ln(2np))$ 时,原始与压缩样本协方差矩阵之间的差异满足 $\|B\|_F = o(1)$,确保主成分分析具有高效率。
- 隐私参数 $\alpha(m,\delta)$ 受包含 $mp\|\Delta\|_F / (\lambda_{\min}(\Sigma_i)\lambda_{\min}(\Sigma_1))$ 和 $\Delta_{\max}$ 的项有界,另有 $O(\sqrt{\ln(2np)/m})$ 阶的附加项。
- 对每种分布下总测度 $\leq 1/n^2$ 的低概率事件进行截断,可确保隐私比值有界,且由于 $O(1/n^2)$ 的归一化误差,对隐私参数的影响可忽略。
- 该方法在差分隐私意义上实现隐私保护,即任意两个数据库的似然比差异至多为乘法因子 $\exp(\alpha(m,\delta))$,且 $\alpha(m,\delta)$ 通过矩阵范数和特征值界得到控制。
- 对于多元正态分布数据,$\Delta_{\max}(\mathcal{S}_n) = O_P(\sqrt{\log p / n})$,为样本协方差与总体协方差之间的偏差提供了具体界。
- 该方法支持私密发布合成数据 $\mathcal{X} = \Phi X$,可准确支持主成分分析及其他基于协方差的分析,优于仅发布扰动汇总统计量的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。