[论文解读] Differentially Private Database Release via Kernel Mean Embeddings
本文提出了一种新颖的框架,用于在再生核希尔伯特空间(RKHS)中使用核均值嵌入(KMEs)实现差分隐私数据库发布。通过发布近似真实数据分布KME的合成数据点,该方法在确保差分隐私的同时,支持对总体统计量的一致估计。其主要贡献是提出了一种理论基础扎实的方法,通过RKHS中的精度控制,同时保证隐私性和统计一致性。
We lay theoretical foundations for new database release mechanisms that allow third-parties to construct consistent estimators of population statistics, while ensuring that the privacy of each individual contributing to the database protected. The proposed framework rests on two main ideas. First, releasing (an estimate of) the kernel mean embedding of the data generating random variable instead of the database itself still allows third-parties to construct consistent estimators of a wide class of population statistics. Second, the algorithm can satisfy the definition of differential privacy by basing the released kernel mean embedding on entirely synthetic data points, while controlling accuracy through the metric available in a Reproducing Kernel Hilbert Space. We describe two instantiations of the proposed framework, suitable under different scenarios, and prove theoretical results guaranteeing differential privacy of the resulting algorithms and the consistency of estimators constructed from their outputs.
研究动机与目标
- 为在保护个体隐私的同时发布完整数据库并支持未来统计推断提供解决方案。
- 开发一种框架,使第三方能够从发布的数据中构建总体统计量的一致估计量。
- 在不依赖汇总统计量或模型输出的前提下,通过保护底层数据表示来确保差分隐私。
- 通过基于RKHS的KME方法,提供一种统一且数学上严谨的方法,适用于多种数据类型。
提出的方法
- 将数据库表示为再生核希尔伯特空间(RKHS)中的核均值嵌入(KME),以捕捉数据的丰富统计特性。
- 通过在输入空间中生成近似真实KME的合成数据点,利用缩减集方法构建合成数据库。
- 通过基于完全合成数据点而非原始私有数据的发布KME来确保差分隐私。
- 通过RKHS范数控制精度,该范数为近似误差提供了一个合理的度量标准。
- 采用两种算法实现:一种是从宽泛的高斯分布中采样合成点(算法1),另一种是通过凸优化确定点的位置(算法2)。
- 证明两种算法均满足(ε, δ)-差分隐私,且基于其输出构建的估计量对总体统计量具有一致性。
实验结果
研究问题
- RQ1RKHS中的核均值嵌入能否作为完整数据库发布中充分且保护隐私的中间表示?
- RQ2当发布近似KME的合成数据时,如何正式保证差分隐私?
- RQ3能否从发布的合成数据中构建总体统计量的一致估计量?
- RQ4估计量的收敛速率如何依赖于合成数据点的数量和隐私参数?
- RQ5该框架能否处理数据库中部分数据已公开的情况?
主要发现
- 所提出的框架通过发布近似真实核均值嵌入的合成数据点,而无需使用任何私有数据,确保了(ε, δ)-差分隐私。
- 算法1和算法2均能产生对真实KME的一致估计量,其收敛速率取决于合成数据点的数量和核函数的选择。
- 由于合成点位置经过优化,算法2在RKHS距离上优于算法1,但性能依赖于优化过程。
- 实验结果表明,随着合成数据点数量的增加,RKHS距离减小;而随着隐私预算(ε)的提高,RKHS距离增大。
- 只要能构建一致的KME估计量,该框架在数据库行不独立的情况下依然有效。
- 该方法可无限次重复使用合成数据库进行诸如两样本检验和MMD估计等任务,且隐私损耗不会累积。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。