[论文解读] Information-theoretic metrics for Local Differential Privacy protocols
本文提出了用于本地差分隐私(LDP)协议中效用与隐私的新型信息论度量,区分了用户与聚合器的视角。将效用形式化为聚合器输出与总体分布之间的互信息,将隐私定义为泄露给聚合器的信息量,展示了这些度量如何与标准的ε-LDP保证相关联,并实现了对Unary Encoding等协议中隐私-效用权衡的定量分析。
Local Differential Privacy (LDP) protocols allow an aggregator to obtain population statistics about sensitive data of a userbase, while protecting the privacy of the individual users. To understand the tradeoff between aggregator utility and user privacy, we introduce new information-theoretic metrics for utility and privacy. Contrary to other LDP metrics, these metrics highlight the fact that the users and the aggregator are interested in fundamentally different domains of information. We show how our metrics relate to $\varepsilon$-LDP, the \emph{de facto} standard privacy metric, giving an information-theoretic interpretation to the latter. Furthermore, we use our metrics to quantitatively study the privacy-utility tradeoff for a number of popular protocols.
研究动机与目标
- 为解决现有LDP隐私与效用度量的局限性,提出反映用户与聚合器不同利益的信息论替代度量。
- 为ε-LDP提供一种基于信息论的严谨解释,将最坏情况下的隐私保证与平均情况下的信息泄露联系起来。
- 通过基于互信息和熵的度量,实现对主流LDP协议中隐私-效用权衡的定量评估。
- 将效用正式定义为聚合器输出与底层总体分布之间的互信息,避免因特定频率预言机带来的偏差。
- 通过在总体分布$P$上使用非信息性Jeffreys先验$\mu$,建模聚合器的非信息性先验知识,从而支持对总体统计量的贝叶斯估计。
提出的方法
- 提出一种新的效用度量$\operatorname{U}^{\text{distr}}_{n,\mu}(\mathcal{P})$,定义为聚合器输出$\vec{Y}$与总体分布$P$之间的互信息$\operatorname{I}(\vec{Y}; P)$。
- 基于信息泄露定义一种隐私度量,衡量在给定总体统计量的条件下,用户真实数据与聚合器输出之间的互信息。
- 在总体分布$P$上使用Jeffreys先验$\mu$来建模聚合器的非信息性先验知识,从而支持贝叶斯推断。
- 在参数为$\kappa, \lambda$的Unary Encoding(UE)机制下,推导出$\operatorname{I}(\vec{Y}; P)$的闭式表达式,使用组合求和与Beta函数。
- 引入函数$F(s, \kappa, \lambda)$,用于计算输出配置$\vec{Y}$的边缘似然,对所有可能的中间状态$k$和$m^y$进行聚合。
- 建立计算效用度量的复杂度上界为$\mathcal{O}(n^{1+(a+1)2^{a-1}})$,涵盖所有可能的用户结果模式及其概率组合。
实验结果
研究问题
- RQ1如何使用反映用户与聚合器不同利益的信息论度量来衡量LDP协议中的效用与隐私?
- RQ2标准ε-LDP保证与通过互信息衡量的平均情况信息泄露之间存在何种信息论关系?
- RQ3在不同LDP协议(如Unary Encoding)中,聚合器输出与总体分布之间的互信息如何变化?
- RQ4能否为参数为$\kappa, \lambda$的Unary Encoding机制下的互信息$\operatorname{I}(\vec{Y}; P)$推导出闭式表达式?
- RQ5评估所提出的效用度量在所有可能用户结果配置下的计算复杂度是多少?
主要发现
- 所提出的效用度量$\operatorname{U}^{\text{distr}}_{n,\mu}(\mathcal{P}) = \operatorname{I}(\vec{Y}; P)$量化了聚合器从噪声输出中获得的关于总体分布的信息量。
- 本文推导出在Unary Encoding机制下$\operatorname{I}(\vec{Y}; P)$的闭式表达式,涉及对所有可能的用户结果模式$s$、中间计数$k$和子集配置$m^y$的求和。
- 互信息$\operatorname{I}(\vec{Y}; P)$表示为输出$\vec{Y}$的熵与条件熵$\operatorname{H}(\vec{Y}|P)$之差,两项均通过组合与Beta函数表达式计算得出。
- 计算效用度量的复杂度被限制在$\mathcal{O}(n^{1+(a+1)2^{a-1}})$,该复杂度考虑了用户响应配置的数量及其概率聚合。
- 该框架为ε-LDP提供了严谨的信息论解释,表明ε-LDP对应于信息泄露的最坏情况边界,而新度量则捕捉了平均情况行为。
- 结果表明,输入与输出之间的互信息高估了效用,因为它包含了来自单个用户的信息,而所提出的度量则隔离了与总体统计量相关的信息。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。