Skip to main content
QUICK REVIEW

[论文解读] Information-Theoretic Single-Server PIR in the Shuffle Model

Ishai, Yuval, Kelkar, Mahimna|arXiv (Cornell University)|Jan 1, 2024
Privacy-Preserving Technologies in Data被引用 18
一句话总结

本文在shuffle模型中形式化了单服务器私有信息检索(PIR)的Encode, Shuffle, Analyze(ESA)框架,表明报告分段与混淆显著提升了隐私-效用权衡。研究显示,通过混淆的一次性编码可实现高精度深度学习训练(如在MNIST数据集上达到70%准确率),同时实现较强的中心化微差分隐私(εc ≈ 0.5)与本地隐私(εℓ∞ ≈ 12)。

ABSTRACT

We revisit the problem of private information retrieval (PIR) in the shuffle model, where queries can be made anonymously by multiple clients. We present the first single-server PIR protocol in this model that has sublinear per-client communication and information-theoretic security. Moreover, following one-time preprocessing on the server side, our protocol only requires sublinear per-client computation. Concretely, for every γ > 0, the protocol has O(n^{γ}) communication and computation costs per (stateless) client, with 1/poly(n) statistical security, assuming that a size-n database is simultaneously accessed by poly(n) clients. This should be contrasted with the recent breakthrough result of Lin, Mook, and Wichs (STOC 2023) on doubly efficient PIR in the standard model, which is (inherently) limited to computational security.

研究动机与目标

  • 形式化并阐明shuffle模型中Encode, Shuffle, Analyze(ESA)框架的隐私保障。
  • 为实际部署匿名化、微差分隐私报告提供指导性建议。
  • 通过真实世界数据集,实证评估基于草图的编码与一次性编码在隐私-效用权衡上的表现。
  • 证明仅使用微差分隐私、匿名化报告即可训练高精度深度神经网络。

提出的方法

  • 提出一个简洁、抽象的威胁模型,涵盖具备不同能力的攻击者,包括共谋方与全局攻击者。
  • 引入形式化的隐私会计框架,将本地微差分隐私(LDP)保障转化为替换模型下的中心化微差分隐私(CDP)保障。
  • 将报告分段——即把数据拆分为无法关联的消息——作为核心机制,以在不损失效用的前提下提升隐私性。
  • 使用具有重尾分布或近似平坦分布的真实世界数据集(如图像数据)评估重建准确率与模型性能。
  • 应用成员推断攻击以估计隐私泄露的下限,对比ESA与DPSGD训练模型的表现。
  • 采用高级组合与Rényi微差分隐私会计作为提升中心化隐私边界的潜在改进方法。

实验结果

研究问题

  • RQ1通过混淆实现的匿名化在本地微差分隐私机制中如何改善隐私-效用权衡?
  • RQ2报告分段(即在无法关联的消息中编码数据的不同方面)对中心化与本地微差分隐私保障有何影响?
  • RQ3在真实世界数据分布下,基于草图的编码与一次性编码在效用与隐私方面有何比较?
  • RQ4能否仅使用微差分隐私、匿名化报告训练出高精度的深度神经网络?
  • RQ5当前基于草图的LDP机制在实际部署中结合匿名化时存在哪些局限性?

主要发现

  • ESA框架中的报告分段对于在保持高实用性的同时实现强中心化微差分隐私保障至关重要。
  • 经过混淆的一次性编码报告可实现在MNIST数据集上训练深度神经网络,准确率达到70%,且中心化微差分隐私参数εc ≈ 0.5。
  • 尽管形式化上界表明不同,但实证结果表明,基于草图的编码在重尾数据上通常在效用方面表现不如一次性编码,尤其在重尾分布下。
  • 成员推断攻击表明,尽管上界不同,ESA与DPSGD训练模型的隐私泄露下限(ε ≥ −log(max(TPR − FPR))))相似。
  • 当前基于高级组合的中心化隐私会计可能过于宽松,提示可通过Rényi微差分隐私实现更紧致的边界。
  • 目前迫切需要更优的草图构造方法与隐私分析,以在shuffle模型中合理考虑匿名性与分段机制的双重影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。