[论文解读] Faster Algorithms for Privately Releasing Marginals
该论文提出了首个用于发布 k 路边际查询的差分隐私算法,其运行时间与最小数据库规模均显著低于 d^k,且在时间 d^{O(√k)} 内实现 O(1) 的最坏情况误差。该方法利用低次多项式逼近,通过向多项式基的系数添加噪声,高效地表示并私密发布边际查询,即使在 k 较大时也能实现亚指数级运行时间。
We study the problem of releasing $k$-way marginals of a database $D \in (\{0,1\}^d)^n$, while preserving differential privacy. The answer to a $k$-way marginal query is the fraction of $D$'s records $x \in \{0,1\}^d$ with a given value in each of a given set of up to $k$ columns. Marginal queries enable a rich class of statistical analyses of a dataset, and designing efficient algorithms for privately releasing marginal queries has been identified as an important open problem in private data analysis (cf. Barak et. al., PODS '07). We give an algorithm that runs in time $d^{O(\sqrt{k})}$ and releases a private summary capable of answering any $k$-way marginal query with at most $\pm .01$ error on every query as long as $n \geq d^{O(\sqrt{k})}$. To our knowledge, ours is the first algorithm capable of privately releasing marginal queries with non-trivial worst-case accuracy guarantees in time substantially smaller than the number of $k$-way marginal queries, which is $d^{Θ(k)}$ (for $k \ll d$).
研究动机与目标
- 设计一种高效的差分隐私算法,用于发布 k 路边际查询,并提供非平凡的最坏情况准确度保证。
- 克服先前方法在运行时间上呈 d^{Θ(k)} 或 2^d 的指数级增长瓶颈,即使在小 k 的情况下也存在此问题。
- 在私密边际查询发布中同时实现低运行时间与低样本复杂度(n ≥ d^{O(√k)})。
- 将私密数据发布方法的适用范围扩展至 n ≪ d^k 的场景,例如大规模数据集但 k 中等的情况。
- 提供一个通用的私密查询发布框架,基于多项式逼近,可适配于其他查询类别。
提出的方法
- 该算法使用低次实多项式,在布尔立方体 {0,1}^d 上对 k 路边际查询族进行一致逼近。
- 构建一个总次数为 O(√k log(1/α)) 的单项式基,以高效表示查询空间。
- 通过统计查询预言机计算真实的边际计数,并向多项式逼近的系数添加校准后的拉普拉斯噪声。
- 通过使用系数向量的 ℓ1 范数有界多项式系数的敏感性,确保 (ε, δ)-差分隐私。
- 该方法利用在 m 个变量中,t 次单项式的数量为 O(m^t) 的事实,当 t = O(√k) 时,该数量在 k 上为亚指数级。
- 最终的私密摘要可通过在查询模式处求值噪声多项式,以 ±α 的加法误差回答任意 k 路边际查询。
实验结果
研究问题
- RQ1我们能否设计一种差分隐私算法,使 k 路边际查询的运行时间显著低于 d^k?
- RQ2当 n 仅为 d^{O(√k)} 时,是否可能在子指数时间内实现常数级最坏情况误差(例如 ±0.01)?
- RQ3能否利用多项式逼近来降低边际查询私密查询发布复杂度?
- RQ4在私密边际查询发布中,运行时间、样本复杂度与误差之间的权衡是什么?
- RQ5统计查询模型能否用于实现具有子指数查询复杂度的差分隐私算法,以支持边际查询?
主要发现
- 该算法运行时间为 d^{O(√k)},且在 n ≥ d^{O(√k)}/ε 的条件下,可发布一个私密摘要,使所有 k 路边际查询的误差在 ±α 以内。
- 当 k = d 时,该算法运行时间为 2^{Õ(√d)},是首个已知可在亚指数时间内发布所有边际查询的算法。
- 当 n ≥ d^{O(√k)} 且 ε 为常数时,该方法以高概率实现 ±0.01 的最坏情况误差。
- 所需统计查询的数量在 d 和 √k 上为多项式级别,因此当 k 为常数时,该算法可在统计查询模型中以多项式查询复杂度实现。
- 该方法不仅适用于单调析取式,还可推广至任何可通过有界系数的低次多项式进行一致逼近的查询族。
- Klivans 和 Sherstov 的下界表明,对于通用函数族,无法实现显著改进,因为任何此类族对于 k 路析取式必须至少具有 2^{Ω(√k)} 的大小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。