[论文解读] Precision-based attacks and interval refining: how to break, then fix, differential privacy on finite computers
本文提出区间精炼(interval refining)这一新方法,通过迭代缩小区间直至其映射到单个浮点数,安全地在有限精度计算机上实现差分隐私机制。该方法确保最小误差与可证明隐私,其效果等同于从连续分布精确采样后四舍五入,且在每轮迭代中仅引入不可避免的舍入误差。该方法已应用于拉普拉斯机制,实现每秒30,000个样本的吞吐量,98%的样本在一回合内终止。
Despite being raised as a problem over ten years ago, the imprecision of floating point arithmetic continues to cause privacy failures in the implementations of differentially private noise mechanisms. In this paper, we highlight a new class of vulnerabilities, which we call \emph{precision-based attacks}, and which affect several open source libraries. To address this vulnerability and implement differentially private mechanisms on floating-point space in a safe way, we propose a novel technique, called \emph{interval refining}. This technique has minimal error, provable privacy, and broad applicability. We use interval refining to design and implement a variant of the Laplace mechanism that is equivalent to sampling from the Laplace distribution and rounding to a float. We report on the performance of this approach, and discuss how interval refining can be used to implement other mechanisms safely, including the Gaussian mechanism and the exponential mechanism.
研究动机与目标
- 识别并展示一类新型漏洞——基于精度的攻击,此类攻击会破坏浮点数实现中的差分隐私。
- 解决现有主流库中缓解技术的局限性,这些技术或过于复杂、无法泛化,或引入隐私损失。
- 设计一种技术,实现在有限精度系统上对连续分布进行安全、可证明私密且误差最小的采样。
- 展示该方法在拉普拉斯机制之外的广泛适用性,包括高斯机制与指数机制。
提出的方法
- 该方法采用区间精炼:在浮点数空间中迭代采样并缩小区间,直至整个区间四舍五入为单个浮点数。
- 利用Arb库提供的任意精度球算术计算分位函数的逆函数,确保误差有界,从而保障正确性。
- 与每轮仅采样1比特不同,该实现每步采样63比特,将运行时间减少约40倍,同时保持正确性。
- 该方法模拟从连续分布中精确采样后四舍五入的过程,误差仅来自不可避免的舍入步骤。
- 当区间缩小至可表示为单个浮点数时,终止条件被满足,确保每个样本输出的确定性。
- 该技术具有通用性,通过调整终止条件,可适用于其他机制,如带噪声的argmax与分位数估计。
实验结果
研究问题
- RQ1浮点数算术如何在使用标准噪声分布时,仍导致差分隐私机制中的隐私泄露?
- RQ2为何主流库(如diffprivlib、SmartNoise Core与OpenDP)中现有的缓解策略仍易受基于精度的攻击影响?
- RQ3能否设计一种技术,确保在差分隐私的浮点数实现中同时实现最小误差与可证明隐私?
- RQ4如何利用区间精炼安全地实现拉普拉斯机制,且性能可与朴素浮点数采样相媲美?
- RQ5区间精炼在多大程度上可泛化至其他差分隐私机制,如高斯机制与指数机制?
主要发现
- 所提出的区间精炼技术在误差上与从拉普拉斯分布精确采样后四舍五入至最近浮点数完全一致,采样过程未引入额外误差。
- 在Tumult平台上的实现达到每秒30,000个样本的吞吐量,展现出实际性能。
- 在2000万次试验中,98%的样本在一回合内终止,仅2%需要两轮迭代,无样本需要三轮或以上迭代。
- 该方法具备可证明隐私,其隐私保证与抽象算法完全一致,兼容纯差分隐私与零集中差分隐私的计数方法。
- 该技术具有鲁棒性与通用性,未来可扩展至复杂机制,如指数机制与带噪声的argmax。
- 使用Arb的球算术确保了计算全程的正确性,即使在近似计算逆分位函数时也能严格控制误差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。