Skip to main content
QUICK REVIEW

[论文解读] One-shot Empirical Privacy Estimation for Federated Learning

Galen Andrew, Peter Kairouz|arXiv (Cornell University)|Feb 6, 2023
Privacy-Preserving Technologies in Data被引用 6
一句话总结

本文提出了一种联邦学习的一次性经验隐私估计方法,可在单次训练过程中估计用户级别的差分隐私(DP)epsilon值,而无需重新训练或事先了解模型架构、数据或DP算法。通过插入多个独立的canary客户端并使用随机更新,该方法在保证可证明正确性的同时,以极低的计算开销高效估计高斯机制下的隐私损失,其准确性和效率均优于以往需要多次运行的方法。

ABSTRACT

Privacy estimation techniques for differentially private (DP) algorithms are useful for comparing against analytical bounds, or to empirically measure privacy loss in settings where known analytical bounds are not tight. However, existing privacy auditing techniques usually make strong assumptions on the adversary (e.g., knowledge of intermediate model iterates or the training data distribution), are tailored to specific tasks, model architectures, or DP algorithm, and/or require retraining the model many times (typically on the order of thousands). These shortcomings make deploying such techniques at scale difficult in practice, especially in federated settings where model training can take days or weeks. In this work, we present a novel "one-shot" approach that can systematically address these challenges, allowing efficient auditing or estimation of the privacy loss of a model during the same, single training run used to fit model parameters, and without requiring any a priori knowledge about the model architecture, task, or DP training algorithm. We show that our method provides provably correct estimates for the privacy loss under the Gaussian mechanism, and we demonstrate its performance on well-established FL benchmark datasets under several adversarial threat models.

研究动机与目标

  • 为解决现有联邦学习隐私审计技术在可扩展性和实用性方面的局限性,这些技术通常需要数千次重新训练,且对攻击者或模型有强假设。
  • 在无需事先了解模型架构、任务或数据分布的前提下,实现在联邦学习中高效、单次训练运行的隐私估计。
  • 即使在非独立同分布(non-iid)数据和有限客户端参与等复杂真实联邦学习环境中,也能提供高斯机制下隐私损失的可证明正确估计。
  • 提供一种通用、与模型无关的方法,可无需定制化或昂贵的canary构造,广泛应用于各类联邦学习场景。

提出的方法

  • 在联邦训练过程中插入多个独立的canary客户端,每个客户端使用设计为模拟客户端贡献的随机模型更新。
  • 利用最终模型与每个canary更新的点积来估计成员推断的可能性,从而构建隐私损失代理指标。
  • 通过分析所有canary的这些点积分布来估计隐私参数ε,利用高斯机制的统计特性。
  • 应用一次性估计框架,避免迭代重新训练,实现在与模型优化相同训练运行中进行隐私审计。
  • 使用已见和未见的canary验证ε估计在不同训练动态下的鲁棒性和一致性。
  • 通过避免模型特定或数据特定的canary构造,确保极低的计算开销,使方法与任务、模型或数据无关。

实验结果

研究问题

  • RQ1是否可以仅通过一次训练运行,在无需重新训练的情况下,经验性估计联邦学习中的用户级别差分隐私?
  • RQ2与现有的多轮隐私审计技术相比,所提出的单次方法在准确性和效率方面表现如何?
  • RQ3当canary数量变化或训练动态偏离理想化假设时,该方法的鲁棒性如何?
  • RQ4即使缺乏解析边界的前提下,该方法是否能检测到由于非i.iid数据、非均匀客户端采样或非各向同性噪声导致的隐私泄漏?
  • RQ5在解析边界宽松或不可用的情况下,该方法对ε的估计与真实隐私损失的关系如何?

主要发现

  • 在受控环境中,该方法的估计值(如6.76)显著接近解析ε边界(如34.5),远优于CANIFE方法(0.879),展现出更高的准确性。
  • 使用1000个canary在单次运行中得到的隐私估计值,与使用十次运行、每次100个canary的结果几乎完全一致,表明在不同canary数量下具有高度一致性和鲁棒性。
  • 在50次实验中,估计ε值的分布稳定且高度集中,对噪声乘数和canary配置的变化具有极小的波动。
  • 即使训练过程偏离理想的i.i.i.d.假设,该方法仍能在高斯机制下提供可证明正确的估计。
  • 该方法引入的计算开销可忽略不计,且无需模型特定或数据特定的canary构造,因此可在各类联邦学习系统中广泛适用。
  • 在StackOverflow和fashion MNIST数据集上的实证结果表明,该方法可提供可靠、单次运行的隐私估计,且不会降低模型效用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。