Skip to main content
QUICK REVIEW

[论文解读] Hypothesis Testing under Maximal Leakage Privacy Constraints

Jiachun Liao, Lalitha Sankar|arXiv (Cornell University)|Jan 24, 2017
Privacy-Preserving Technologies in Data参考文献 4被引用 11
一句话总结

本文通过使用最大泄漏(ML)作为隐私度量,类型-II错误指数作为效用度量,研究了假设检验中的隐私-效用权衡。对于二元源,推导出闭式最优隐私机制,揭示输入符号的完全或部分知识,表明在严格隐私约束下,高效率迫使对某些输入采用确定性或近乎确定性的映射。

ABSTRACT

The problem of publishing privacy-guaranteed data for hypothesis testing is studied using the maximal leakage (ML) as a metric for privacy and the type-II error exponent as the utility metric. The optimal mechanism (random mapping) that maximizes utility for a bounded leakage guarantee is determined for the entire leakage range for binary datasets. For non-binary datasets, approximations in the high privacy and high utility regimes are developed. The results show that, for any desired leakage level, maximizing utility forces the ML privacy mechanism to reveal partial to complete knowledge about a subset of the source alphabet. The results developed on maximizing a convex function over a polytope may also of an independent interest.

研究动机与目标

  • 通过使用最大泄漏(ML)作为隐私度量,建立假设检验中的隐私-效用权衡(PUT)。
  • 确定在有界ML约束下,能最大化类型-II错误指数(效用)的最优随机化机制(隐私映射)。
  • 表征最优机制的结构,特别是其在隐私约束下如何揭示输入符号的部分或完全知识。
  • 通过在高隐私和高效率区域的渐近近似,将二元源的结果扩展到非二元源。
  • 证明最优机制源于在由ML约束定义的多面体上最大化一个凸函数。

提出的方法

  • 将隐私-效用权衡表述为约束优化问题:在 $ L(X \to \hat{X}) \leq \ell $ 约束下,最大化相对熵 $ D(\tilde{\mathbf{p}}_1 \| \tilde{\mathbf{p}}_2) $(即类型-II错误指数)。其中 $ \ell $ 为最大泄漏预算。
  • 利用最大泄漏等价于无穷阶Sibson互信息的性质,使隐私约束得以可处理地表述。
  • 对于二元源,通过在由ML约束定义的多面体上求解凸优化问题,推导出最优机制 $ \mathbf{W}^* $ 的闭式表达式。
  • 对于非二元源,应用EIT(指数同序变换)近似方法,以处理高维空间中可行区域的复杂性。
  • 利用对称性和列置换不变性,简化最优机制的结构,将不同行的数量减少至两个。
  • 利用目标函数的偏导数矩阵 $ \boldsymbol{\Psi} $,证明 $ \mathbf{W}^* $ 的最优行会将质量集中在 $ \boldsymbol{\Psi} $ 的最大对角线元素上,从而导致稀疏且结构化的机制。

实验结果

研究问题

  • RQ1对于二元数据,在最大泄漏隐私约束下,最大化效用(类型-II错误指数)的最优隐私机制是什么?
  • RQ2随着泄漏预算 $ \ell $ 变化,最优机制的结构如何变化,特别是其在确定性与随机化映射之间的转变?
  • RQ3在高隐私和高效率区域,非二元源的隐私-效用权衡的渐近近似是什么?
  • RQ4最优机制如何揭示关于输入的信息——具体而言,它是否揭示了某些输入符号的完全或部分知识?
  • RQ5由于相对熵的凸性与由最大泄漏定义的多面体约束集之间的相互作用,最优机制中出现了哪些结构性特征?

主要发现

  • 对于二元源,最优机制对两个输入值中的一个,能以确定性方式揭示原始输入符号,即对一个输入为确定性映射,对另一个为噪声映射。
  • 二元数据的最优机制具有显式依赖于泄漏预算 $ \ell $ 的闭式解,其映射结构在临界阈值处发生变化。
  • 在高隐私区域($ \ell $ 较大时),最优机制趋近于均匀随机化;在高效率区域($ \ell $ 较小时),对一个输入符号的映射变得越来越确定。
  • 对于非二元源,EIT近似得到的机制中,$ \mathbf{W}^* $ 的每一行最多有两个非零条目,且最优解将质量集中在偏导数矩阵 $ \boldsymbol{\Psi} $ 的最大条目上。
  • 二元数据的最优机制在ML约束下实现了最大可能的效用(相对熵),且该最大值严格小于 $ D(\mathbf{p}_1 \| \mathbf{p}_2) $,除非 $ \ell = \infty $。
  • 二元数据的最优机制在保持两个不同行不变的列置换下保持不变,表明输出符号的标签不影响效用-隐私权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。