[论文解读] Iterative Methods for Private Synthetic Data: Unifying Framework and New Methods
本文提出了一种用于迭代差分隐私合成数据生成的统一框架,并引入两种新方法:私有熵投影(PEP),通过自适应学习率和熵正则化改进MWEM;以及基于指数机制的生成网络(GEM),利用神经网络高效优化复杂分布。GEM在ε=1时相较于PMW Pub将2018年ACS数据的最大误差降低9.23倍,达到最先进性能。
We study private synthetic data generation for query release, where the goal is to construct a sanitized version of a sensitive dataset, subject to differential privacy, that approximately preserves the answers to a large collection of statistical queries. We first present an algorithmic framework that unifies a long line of iterative algorithms in the literature. Under this framework, we propose two new methods. The first method, private entropy projection (PEP), can be viewed as an advanced variant of MWEM that adaptively reuses past query measurements to boost accuracy. Our second method, generative networks with the exponential mechanism (GEM), circumvents computational bottlenecks in algorithms such as MWEM and PEP by optimizing over generative models parameterized by neural networks, which capture a rich family of distributions while enabling fast gradient-based optimization. We demonstrate that PEP and GEM empirically outperform existing algorithms. Furthermore, we show that GEM nicely incorporates prior information from public data while overcoming limitations of PMW^Pub, the existing state-of-the-art method that also leverages public data.
研究动机与目标
- 将不同迭代算法统一于单一算法框架下,以支持差分隐私合成数据生成。
- 开发新方法以在准确性和效率上超越现有方法(如MWEM和PMW Pub)。
- 在隐私查询发布中有效利用公共数据,同时克服先前方法的局限性。
- 通过神经网络参数化缓解高维场景下的计算瓶颈。
- 通过实证验证所提方法在多个数据集和隐私预算下均优于最先进基线。
提出的方法
- 提出一个统一框架,将迭代差分隐私合成数据算法定义为其损失函数与分布参数化形式,涵盖现有方法如MWEM与FEM。
- 引入私有熵投影(PEP),通过自适应学习率与熵正则化最小化正则化指数损失,从而在收敛性与准确性上优于MWEM。
- 开发基于指数机制的生成网络(GEM),采用神经网络参数化合成分布,并通过梯度优化方法避免MWEM的指数级运行时间。
- 将GEM扩展以通过预训练整合公共数据,从而有效利用ACS等公共数据集中的先验信息。
- 采用RAP的softmax变体(RAP softmax)作为基线,显示其在稀疏查询场景下性能优于标准RAP。
- 采用一种在迭代间重用历史查询测量结果的框架,性能优于标准MWEM。
实验结果
研究问题
- RQ1能否构建一个统一框架,以捕捉并泛化现有迭代差分隐私合成数据算法?
- RQ2能否设计一种新方法(PEP),通过自适应学习率与熵正则化改进MWEM?
- RQ3基于神经网络的生成模型(GEM)能否在保持差分隐私与准确性的同时,有效扩展至高维数据?
- RQ4如何在不引入现有方法(如PMW Pub)局限性的前提下,有效利用公共数据进行隐私查询发布?
- RQ5为何RAP在某些数据集(如ADULT)上表现较差,而在其他数据集(如ADULT*)上表现合理,尽管工作负载相似?
主要发现
- 在ε=1时,GEM将2018年宾夕法尼亚州ACS数据的最大误差较PMW Pub降低9.23倍,表明其在高维场景下具有卓越性能。
- PEP通过自适应学习率与熵正则化实现误差随轮次单调下降,从而在收敛速度与准确性上优于MWEM。
- 所提框架成功恢复并泛化了现有方法(如MWEM、FEM与DualQuery),通过指定适当的损失函数与参数化形式实现。
- RAP softmax(RAP的softmax变体)在所有隐私预算下均优于标准RAP,尤其在稀疏查询工作负载中显著降低最大误差。
- RAP在ADULT与ADULT*上表现差异的原因在于高精度查询的稀疏性:ADULT*的高精度查询更少(71个 vs. 487个),使RAP更容易优化。
- GEM在高维数据上表现出强鲁棒性,在ADULT*与LOANS数据集的三重边际统计中,于最大误差与RMSE指标上均优于所有对比方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。