[论文解读] Differentially Private Linear Sketches: Efficient Implementations and Applications
本论文通过在初始化时添加高斯噪声,提出了一种差分隐私线性草图,实现了在流式处理模型中对频率估计、Top-K项目识别和分位数近似的隐私保护。该方法在误差增长可忽略不计的情况下保持了高实用性,实现了集中式差分隐私,并首次在流式处理模型中提出了具有可证明误差边界的差分隐私分位数草图。
Linear sketches have been widely adopted to process fast data streams, and they can be used to accurately answer frequency estimation, approximate top K items, and summarize data distributions. When data are sensitive, it is desirable to provide privacy guarantees for linear sketches to preserve private information while delivering useful results with theoretical bounds. We show that linear sketches can ensure privacy and maintain their unique properties with a small amount of noise added at initialization. From the differentially private linear sketches, we showcase that the state-of-the-art quantile sketch in the turnstile model can also be private and maintain high performance. Experiments further demonstrate that our proposed differentially private sketches are quantitatively and qualitatively similar to noise-free sketches with high utilization on synthetic and real datasets.
研究动机与目标
- 在保持线性草图核心特性(如效率和准确性)的同时,实现差分隐私。
- 支持流式处理模型中的插入与删除操作,与以往仅限于仅插入或有界删除模型的研究不同。
- 在流式处理模型中构建首个具有可证明误差边界的差分隐私分位数草图。
- 通过保持对任意查询操作的后处理免疫性,确保隐私性不受影响。
- 在合成数据集和真实世界数据集上,证明私有草图的实用性接近无噪声对照方案。
提出的方法
- 在初始化时向初始草图矩阵添加高斯噪声,以实现集中式差分隐私,而不修改更新或查询过程。
- 利用高斯机制提供强隐私保障,同时保持原始草图结构和特性。
- 以私有 CountSketch 为基础,构建适用于流式处理模型的差分隐私分位数草图(DP DCS)。
- 推导所有项目估计误差上确界的统一误差界,确保对所有查询的鲁棒性。
- 使用理想随机哈希函数(实际中替换为密码学哈希函数)以确保随机性与隐私性。
- 应用后处理免疫性,允许任意数量的查询而不会降低隐私保障。
实验结果
研究问题
- RQ1是否可以通过仅在初始化时添加噪声,使线性草图实现差分隐私,同时对实用性影响最小?
- RQ2所提出的方法是否能在保持隐私与准确性的前提下,支持流式处理模型中的插入与删除操作?
- RQ3是否可以利用私有线性草图在流式处理模型中构建首个差分隐私分位数草图?
- RQ4私有草图的误差如何随数据库规模、隐私预算和全集大小变化?
- RQ5私有草图是否能保持 Count-Min 草图的无低估特性,同时确保差分隐私?
主要发现
- 所提出的差分隐私线性草图保持了高实用性,平均排名误差低于理论上限 γ·N = 10³ 的一个数量级(当 N = 10⁵ 时)。
- 对于 DP DCS,增加均匀分布的分位数数量不会导致平均排名误差上升,表明在不同分位数分辨率下性能稳定。
- 随着隐私预算降低(如 ρ = 0.1),平均排名误差有所增加,但相对于数据库规模而言增长较小,尤其在 N 较大时更为明显。
- 私有 Count-Min 草图以高概率保持了无低估特性,而基于拉普拉斯噪声的方法则会破坏该特性。
- 为 supₓ|f̂(x)−f̃(x)| 推导出的统一误差界,实现了更紧密的整体误差控制,并可通过三角不等式与点对点误差界结合使用。
- 通过高斯机制实现集中式差分隐私,其保障强度优于基于二项分布噪声的近似差分隐私,且在实用性与特性保持方面优于基于拉普拉斯噪声的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。