Skip to main content
QUICK REVIEW

[论文解读] Efficient Differentially Private $F_0$ Linear Sketching

Rasmus Pagh, Nina Mesing Stausholm|IT University Of Copenhagen (IT University of Copenhagen)|Jan 31, 2020
Privacy-Preserving Technologies in Data参考文献 44被引用 4
一句话总结

本论文提出了一种高效且差分隐私保护的线性投影方法,用于估计加权 $F_0$ 范数,定义为 $\|x \circ w\|_1$,其中 $x$ 为二值向量,$w$ 为取值于 $(0,1]^u$ 的权重向量。通过将 GF(2) 上的线性投影与随机响应噪声相结合,该方法实现了 $\varepsilon$-差分隐私,$O(\log^2 u / \varepsilon^2 \beta^2)$ 的投影大小,以及 $1\pm\beta$ 的相对误差与 $O(\log u / \varepsilon^2 \beta^2)$ 的加法误差,同时支持在分布式流式计算场景中高效合并投影结果。

ABSTRACT

A powerful feature of linear sketches is that from sketches of two data vectors, one can compute the sketch of the difference between the vectors. This allows us to answer fine-grained questions about the difference between two data sets. In this work, we consider how to construct sketches for weighted $F_0$, i.e., the summed weights of the elements in the data set, that are small, differentially private, and computationally efficient. Let a weight vector $w\in(0,1]^u$ be given. For $x\in\{0,1\}^u$ we are interested in estimating $\Vert x\circ w\Vert_1$ where $\circ$ is the Hadamard product (entrywise product). Building on a technique of Kushilevitz et al.~(STOC 1998), we introduce a sketch (depending on $w$) that is linear over GF(2), mapping a vector $x\in \{0,1\}^u$ to $Hx\in\{0,1\}^τ$ for a matrix $H$ sampled from a suitable distribution $\mathcal{H}$. Differential privacy is achieved by using randomized response, flipping each bit of $Hx$ with probability $p<1/2$. We show that for every choice of $0

研究动机与目标

  • 设计一种差分隐私线性投影方法,使其在流式或分布式环境中能够高效、准确地估计加权 $F_0$ 范数 $\|x \circ w\|_1$。
  • 克服先前差分隐私 $F_0$ 投影方法在噪声校准过程中需要准多项式或超线性时间的计算低效问题。
  • 将现有差分隐私投影技术扩展至处理加权数据,其中每个元素的权重属于 $(0,1]$。
  • 实现在分布式数据流中对集合操作(如对称差和并集)大小的安全私密估计。
  • 确保投影结果可高效合并,同时保持差分隐私性与估计准确性。

提出的方法

  • 该方法使用从分布 $\mathcal{H}$ 中采样得到的矩阵 $H$ 构建 GF(2) 上的线性投影,将输入 $x \in \{0,1\}^u$ 映射为 $Hx \in \{0,1\}^\tau$。
  • 通过向 $Hx$ 的每个分量独立添加伯努利噪声 $\varphi_j \sim \text{Bernoulli}(p)$ 实现差分隐私,得到 GF(2) 上的噪声投影 $Hx + \varphi$。
  • 投影大小 $\tau$ 设为 $O(\log^2 u \cdot \varepsilon^{-2} \beta^{-2})$,以确保在高概率下实现 $1\pm\beta$ 的相对误差与 $O(\log u \cdot \varepsilon^{-2} \beta^{-2})$ 的加法误差。
  • 估计算法计算 $Hx + \varphi$ 每行中 1 的个数,利用 $\log u$ 个层级的区间估计,并通过区间交集计算最终估计值。
  • 在分布式流式场景中,引入预采样层:在投影前,每个元素以 $1/2$ 的概率独立采样,确保投影对重复项具有鲁棒性,并支持并集估计。
  • 该方法利用切尔诺夫不等式,确保被采样奇数次的元素比例接近 $1/2$,从而实现估计值的两倍缩放,以恢复真实的加权计数。

实验结果

研究问题

  • RQ1我们能否设计一种既计算高效又空间高效的加权 $F_0$ 估计差分隐私线性投影?
  • RQ2如何在不引入准多项式或超线性时间开销的前提下,通过在 GF(2) 线性投影上应用随机响应实现 $\varepsilon$-差分隐私?
  • RQ3为实现高概率下的 $1\pm\beta$ 相对误差,所需投影大小是多少?其与已知下界相比如何?
  • RQ4在分布式流式环境中,该投影能否高效合并,以估计两个数据集的并集或对称差?
  • RQ5当 $\beta = o(1/\sqrt{\bar{m}})$ 且 $\log u / \varepsilon = \bar{m}^{o(1)}$ 时,该方法是否在误差界方面优于先前工作?

主要发现

  • 投影大小为 $\tau = O(\log^2 u \cdot \varepsilon^{-2} \beta^{-2})$,与已知的 $F_0$ 估计下界 $\Omega(\log u \cdot \beta^{-2})$ 呈多项式关系。
  • 该方法在噪声向量 $\varphi$ 的随机性上实现了 $\varepsilon$-差分隐私,且不依赖于数据或投影矩阵 $H$。
  • 估计误差的相对误差被限制在 $1\pm\beta$ 以内,概率为 $1 - u^{-1}$,加法误差为 $O(\log u \cdot \varepsilon^{-2} \beta^{-2})$。
  • 估计算法运行时间为 $O(\tau)$,投影生成时间为 $O(\|x\|_0 \log u)$,适用于大规模数据的高效计算。
  • 该方法支持投影的高效合并:$H(x_1 + x_2) + (\varphi_1 + \varphi_2)$ 可作为对称差的合法投影,从而在分布式流中实现私密的并集大小估计。
  • 在分布式流式模型中,预采样技术确保两个数据流并集的投影等价于对独立采样后单一流的投影,从而保持了隐私性与准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。