[论文解读] PrivSyn: Differentially Private Data Synthesis
PrivSyn 是一种新颖的差分隐私合成数据生成框架,采用大量低阶联列(而非图模型)来捕捉数据相关性。它引入了一种基于 InDif 指标的私有且高效的联列选择方法,以及一种迭代合成算法,在包含多达 100 个属性、域大小超过 2^500 的表格数据集上实现了高实用性,优于 NIST 差分隐私合成数据挑战赛中的先前方法。
In differential privacy (DP), a challenging problem is to generate synthetic datasets that efficiently capture the useful information in the private data. The synthetic dataset enables any task to be done without privacy concern and modification to existing algorithms. In this paper, we present PrivSyn, the first automatic synthetic data generation method that can handle general tabular datasets (with 100 attributes and domain size $>2^{500}$). PrivSyn is composed of a new method to automatically and privately identify correlations in the data, and a novel method to generate sample data from a dense graphic model. We extensively evaluate different methods on multiple datasets to demonstrate the performance of our method.
研究动机与目标
- 解决现有差分隐私合成数据生成方法在高维表格数据上的可扩展性与实用性局限。
- 克服对稀疏图模型的依赖,后者施加了限制性的条件独立假设。
- 开发一种高效、私有的方法,用于选择信息丰富的联列,而无需依赖互信息等高敏感度指标。
- 实现对合成数据的后处理而无需额外的隐私成本,支持任意下游任务。
- 在严格隐私预算下实现高实用性,即使在域大小极高的数据集上亦能保持良好表现。
提出的方法
- PrivSyn 使用大量低阶联列(例如所有一维联列及约 500 个二维联列)表示数据集,这些联列本身具有低敏感度,因而适用于差分隐私。
- 它引入 InDif,一种低全局敏感度指标,用于度量成对属性的相关性,从而实现私有且高效的联列选择。
- 采用贪心算法,利用 InDif 分数选择最具信息量的联列对,以在实用性与隐私成本之间取得平衡。
- 采用一种迭代合成算法,通过更新合成数据集以匹配噪声联列,使用 MWEM 框架的变体,并通过重叠联列的平均实现方差缩减。
- 通过高级组合或零集中差分隐私(zero-concentrated DP)管理大量联列带来的噪声增长,确保噪声增长与联列数量呈线性关系。
- 合成数据生成过程无需修改现有分析流程,从而实现后处理而无需额外隐私成本。
实验结果
研究问题
- RQ1非参数的、基于联列的方法是否能在差分隐私合成数据生成中超越参数化的图模型方法?
- RQ2低敏感度、私有的指标(如 InDif)是否能有效识别高维数据中的有用相关性,而无需依赖互信息等高敏感度统计量?
- RQ3仅使用低阶联列是否可行生成高质量的合成数据,同时保持强隐私保证,并实现对极大域大小的可扩展性?
- RQ4基于噪声联列的迭代合成过程与现有方法相比,在实用性与隐私-实用性权衡方面表现如何?
- RQ5该方法是否可扩展至属性超过 100 个、域大小超过 2^500 的数据集,同时保持实际性能?
主要发现
- PrivSyn 在多个真实世界数据集上,特别是在高维设置下,相比现有方法(包括 PrivBayes 和 PGM)实现了更优的实用性。
- 该方法成功处理了最多达 100 个属性、域大小超过 2^500 的数据集,而此前方法在该领域表现困难。
- 在 NIST 差分隐私合成数据挑战赛中,PrivSyn 表现优于其他方法,展示了在复杂真实数据上的强大实证性能。
- 使用 InDif 进行联列选择可实现高效、私有的相关性识别,避免了基于互信息方法的计算瓶颈。
- 迭代合成过程能有效收敛至与目标联列高度匹配的合成数据集,即使在严格隐私预算下亦能实现。
- 该框架支持对合成数据进行任意下游分析而无需额外隐私成本,因为所有隐私消耗均在数据生成阶段完成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。