[论文解读] Fast Private Data Release Algorithms for Sparse Queries
本文提出了一种高效、差分私有的算法,用于发布对稀疏统计查询的回答——这些查询仅依赖于数据宇宙中多项式数量的元素。通过随机投影和噪声注入,作者实现了与数据宇宙大小 |X| 无关的准确性,运行时间在数据库大小 n 和查询稀疏度 m 上为多项式时间,从而即使在无限宇宙设置下也能实现实际部署。
We revisit the problem of accurately answering large classes of statistical queries while preserving differential privacy. Previous approaches to this problem have either been very general but have not had run-time polynomial in the size of the database, have applied only to very limited classes of queries, or have relaxed the notion of worst-case error guarantees. In this paper we consider the large class of <em>sparse</em> queries, which take non-zero values on only polynomially many universe elements. We give efficient query release algorithms for this class, in both the interactive and the non-interactive setting. Our algorithms also achieve better accuracy bounds than previous general techniques do when applied to sparse queries: our bounds are independent of the universe size. In fact, even the runtime of our interactive mechanism is independent of the universe size, and so can be implemented in the “infinite universe” model in which no finite universe need be specified by the data curator.
研究动机与目标
- 开发高效、差分私有的算法,用于回答大规模稀疏统计查询类。
- 克服先前通用差分私有机制在运行时间和准确性上的局限性,这些机制的性能随数据宇宙大小 |X| 增大而恶化。
- 通过聚焦于在上下文中具有实际意义的稀疏查询,使具备领域知识的数据分析专家能够实现实际的私有数据分析。
- 在交互式与非交互式查询发布设置中,同时实现计算效率和强准确性保障。
提出的方法
- 使用具有 r 重独立条目的随机投影矩阵,将数据库压缩为低维表示。
- 在投影后的数据上添加拉普拉斯噪声,以确保 (ε, δ)-差分隐私。
- 应用类似 Johnson-Lindenstrauss 的集中极限不等式,控制随机投影带来的失真。
- 利用拉普拉斯和 Rademacher 随机变量之和的尾部界限,控制由隐私机制引入的误差。
- 构建一个非交互式数据结构,编码查询类中所有查询的答案,从而实现快速评估。
- 利用查询的稀疏性(m-稀疏),将准确性与 |X| 解耦,实现仅依赖于 m、n 和 k 的界限。
实验结果
研究问题
- RQ1我们能否设计出在时间复杂度为多项式时间且对大规模稀疏查询类具有高准确性的差分私有查询发布算法?
- RQ2我们能否实现与数据宇宙大小 |X| 无关的准确性,特别是在 |X| 指数级增长的情况下?
- RQ3是否可能设计一种非交互式机制,支持超多项式数量的查询,同时保持非平凡的准确性与多项式时间复杂度?
- RQ4这些算法是否能在无限宇宙模型下运行,即不假设属性值存在有限上界?
- RQ5随机投影是否能有效降低维度,同时在稀疏查询中保持隐私和准确性?
主要发现
- 交互式机制在每次查询的运行时间为 Õ(m/α²),与 |X| 无关,因此可在无限宇宙设置下使用。
- 非交互式机制的运行时间在 n、m 和 log|X| 上为多项式时间,且达到 α-准确性,其界限为 Õ(√(log k / (m log(1/δ)) / (εn)))).
- 准确性界限与 |X| 无关,相较于一般机制(其误差随 log|X| 增长)有显著改进。
- 非交互式机制支持超多项式数量的合取查询(例如,Cd−log n),其规模为 dk,具有非平凡的准确性与多项式时间复杂度。
- 算法对自适应查询选择具有鲁棒性,并在组合下保持隐私。
- 该框架使领域专家能够发布对其实用的私有数据,即使查询是稀疏的,且数据宇宙庞大或无限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。