[论文解读] Differentially Private Continual Release of Graph Statistics
本文提出了一种针对动态网络中图统计量的差分隐私持续发布机制,利用公开已知的节点度数上界来确保差异序列的低敏感性。通过仅对增量变化而非原始统计量添加噪声,该方法在真实网络和合成网络中的度分布与子图计数等任务上,显著优于基线方法,实现了更优的隐私-效用权衡。
Motivated by understanding the dynamics of sensitive social networks over time, we consider the problem of continual release of statistics in a network that arrives online, while preserving privacy of its participants. For our privacy notion, we use differential privacy -- the gold standard in privacy for statistical data analysis. The main challenge in this problem is maintaining a good privacy-utility tradeoff; naive solutions that compose across time, as well as solutions suited to tabular data either lead to poor utility or do not directly apply. In this work, we show that if there is a publicly known upper bound on the maximum degree of any node in the entire network sequence, then we can release many common graph statistics such as degree distributions and subgraph counts continually with a better privacy-accuracy tradeoff. Code available at https://bitbucket.org/shs037/graphprivacycode
研究动机与目标
- 实现动态网络中图统计量(如度分布和子图计数)的持续、隐私保护式发布,其中节点和边在线到达。
- 应对在动态网络结构演化过程中维持强隐私性(节点差分隐私)的同时保证高效率的挑战。
- 克服现有表格数据方法的局限性,这些方法未考虑在线图设置中新边连接到已有节点的情形。
- 证明在已知最大度数边界下,差异序列的敏感性保持较低且与序列长度无关,从而实现精确的噪声添加。
提出的方法
- 引入差异序列的概念,定义为连续时间步之间图统计量的增量变化,以降低敏感性。
- 证明在已知节点度数上界条件下,差异序列的全局敏感性有界且与序列长度无关。
- 对差异序列应用拉普拉斯机制,噪声尺度与有界敏感性匹配,确保节点差分隐私。
- 使用两种主要算法:Compose-D-bounded(直接利用度数边界)和 Compose-projection(投影高阶节点以降低敏感性)。
- 通过累加带噪声的差异值,在每个时间步重建私有统计量,实现具有强隐私保障的持续发布。
- 在真实和合成数据集上实现并评估该方法,与直接对原始统计量应用差分隐私或使用全局敏感性的基线方法进行比较。
实验结果
研究问题
- RQ1在动态网络中,通过利用节点的有界度数特性,是否能够实现比现有方法更优的隐私-效用权衡?
- RQ2在已知最大度数约束下,图统计量差异序列的敏感性行为如何?是否可用于设计高效的差分隐私机制?
- RQ3与直接对原始统计量应用差分隐私或使用朴素组合方法相比,所提方法在度分布与子图计数等任务上的效用是否更优?
- RQ4在存在高阶节点的情况下,该方法的性能在多大程度上依赖于投影策略或直接敏感性估计的选择?
- RQ5该方法在网络规模增大及随时间推移时的可扩展性如何,特别是在重建统计量中误差累积方面?
主要发现
- 常见图统计量(如度分布和子图计数)的差异序列敏感性仅依赖于公开已知的最大度数边界,而不依赖于序列长度,从而支持高效噪声添加。
- Compose-D-bounded 与 Compose-projection 方法在效用上均显著优于直接对原始统计量应用差分隐私或使用整个序列全局敏感性的基线方法。
- 在真实世界数据集(如HIV传播网络)和合成无标度网络中,所提方法在不同隐私参数下,相较于基线方法,统计量发布误差最高可降低50%。
- 重建统计量的误差标准差以 O(√t) 增长,远慢于朴素组合方法中观察到的 O(T) 增长。
- 该方法在保证强节点差分隐私的同时,实现了对随时间演化的图统计量的高精度、持续发布。
- 理论分析证实,差异序列的全局敏感性被 D(或有向图中为 Din + Dout)有界,使得可控制噪声下应用拉普拉斯机制成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。