[论文解读] Interactive Privacy via the Median Mechanism
本文提出中位数机制,一种新颖的交互式差分隐私算法,用于在线回答大量谓词查询。通过利用查询间的相关性,采用基于中位数的噪声分配策略,该机制在隐私性上对查询数量仅呈对数依赖——与最优的非交互式机制相当——同时在大多数数据库上实现了高效多项式时间的实现与高实用性。
We define a new interactive differentially private mechanism -- the median mechanism -- for answering arbitrary predicate queries that arrive online. Relative to fixed accuracy and privacy constraints, this mechanism can answer exponentially more queries than the previously best known interactive privacy mechanism (the Laplace mechanism, which independently perturbs each query result). Our guarantee is almost the best possible, even for non-interactive privacy mechanisms. Conceptually, the median mechanism is the first privacy mechanism capable of identifying and exploiting correlations among queries in an interactive setting. We also give an efficient implementation of the median mechanism, with running time polynomial in the number of queries, the database size, and the domain size. This efficient implementation guarantees privacy for all input databases, and accurate query results for almost all input databases. The dependence of the privacy on the number of queries in this mechanism improves over that of the best previously known efficient mechanism by a super-polynomial factor, even in the non-interactive setting.
研究动机与目标
- 解决现有交互式差分隐私机制的局限性,即随着查询数量增加,隐私保护呈线性退化。
- 通过在在线查询环境中实现相关性感知的噪声分配,弥合非交互式与交互式差分隐私机制之间的差距。
- 设计一种在查询数量、数据库大小和域大小上运行时间均为多项式时间的差分隐私机制的高效实现。
- 实现隐私保证在查询数量上近乎最优的扩展,与目前已知的最佳非交互式机制相当。
- 为几乎所有输入数据库提供强有力的实用性保证,即使在最坏情况下的实用性被牺牲时亦如此。
提出的方法
- 中位数机制使用基于中位数的噪声分配策略,关联查询间的扰动,与独立的拉普拉斯扰动相比,可显著降低总体噪声。
- 提出一种新颖的采样过程——DatabaseSample——从$β(1, |X|-1)$-分布的概率单纯形上采样数据库,以确保均匀性与隐私性。
- 该机制采用连续版本的BLR机制,通过从一个分布中选择阈值,实现相关性感知的噪声分配。
- 通过近似中位数机制,采用一种在查询空间的结构化、低维表示上采样的多项式时间算法,实现高效实现。
- 该机制确保$(\epsilon, \delta)$-实用性,其中$\delta = k \cdot \exp(-\Omega(\epsilon n \alpha'))$,为绝大多数数据库提供高精度。
- 通过精心构造的采样分布和集中性论证,保护隐私,从而限制攻击者重构数据库的概率。
实验结果
研究问题
- RQ1交互式差分隐私机制能否实现对查询数量$k$呈对数依赖的隐私保证,与最优非交互式机制相当?
- RQ2能否设计一种高效、多项式时间的差分隐私机制实现,以在在线环境中关联查询间的噪声?
- RQ3此类机制在不同输入数据库分布下的实用性-隐私权衡如何?
- RQ4该机制能否在保持强隐私性的同时,为几乎所有数据库实现高精度,即使最坏情况下的实用性未被保证?
- RQ5当查询数量超过多项式规模时,该机制的性能是否会显著下降?
主要发现
- 中位数机制实现了对查询数量$k$的对数依赖隐私保护——与最优非交互式机制相当——同时保持完全交互性。
- 与拉普拉斯机制相比,该机制在查询数量上实现了超多项式因子的隐私-实用性权衡改进,即使在非交互式设置中亦如此。
- 高效实现的运行时间在$|X|$、$k$和$n$上均为多项式时间,使其适用于大规模应用。
- 该机制确保对通过DatabaseSample采样的几乎所有数据库(除可忽略的分数外)具有$(\epsilon, \delta)$-实用性,其中$\delta = k \cdot \exp(-\Omega(\epsilon n \alpha'))$。
- 对于均匀随机数据库,该机制对除$O(n^2 / |X|)$的数据库分数外,均保持高实用性,其中$\delta = k \cdot \exp(-\Omega(\epsilon n \alpha'))$。
- 该机制表明,交互性本身并不限制隐私性能,其表现几乎达到理论下限的$\log k$对查询数的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。