[论文解读] On-Average KL-Privacy and its equivalence to Generalization for Max-Entropy Mechanisms
本文提出了平均KL-隐私(On-Average KL-Privacy),这是一种弱化的隐私概念,与最大熵机制(即分布形式为 exp(−ℒ(output, data))π(output) 的分布)的泛化性等价。研究证明,对于这一广泛类别的算法(包括贝叶斯推断和经验风险最小化),平均KL-隐私刻画了泛化误差,为隐私与泛化之间建立了新的信息论联系,并在隐私-效用权衡方面优于微差隐私。
We define On-Average KL-Privacy and present its properties and connections to differential privacy, generalization and information-theoretic quantities including max-information and mutual information. The new definition significantly weakens differential privacy, while preserving its minimalistic design features such as composition over small group and multiple queries as well as closeness to post-processing. Moreover, we show that On-Average KL-Privacy is **equivalent** to generalization for a large class of commonly-used tools in statistics and machine learning that samples from Gibbs distributions---a class of distributions that arises naturally from the maximum entropy principle. In addition, a byproduct of our analysis yields a lower bound for generalization error in terms of mutual information which reveals an interesting interplay with known upper bounds that use the same quantity.
研究动机与目标
- 为弥合强微分隐私与实际效用之间的差距,提出一种较弱的隐私概念,同时仍能保证泛化性。
- 为从吉布斯分布中采样的广泛类别的统计与机器学习算法,形式化隐私与泛化之间的联系。
- 证明平均KL-隐私在最大熵机制中既是泛化性的必要条件也是充分条件。
- 提供一个弱化微分隐私的框架,同时保留组合性与后处理不变性等关键性质。
- 揭示泛化误差的一个新下界,以互信息表示,与已知的上界形成互补。
提出的方法
- 提出平均KL-隐私作为微分隐私的松弛形式,定义为在相邻数据集下输出分布之间KL散度的期望。
- 分析从形式为 p(h|Z) ∝ exp(−ℒ(h,Z))π(h) 的最大熵分布中采样的算法,这类分布常见于贝叶斯推断和经验风险最小化中。
- 使用信息论工具,包括互信息 I(𝒜(Z);Z) 和最大信息 I∞(𝒜,n),来刻画隐私与泛化性。
- 应用自适应组合定理,推导在序列查询下平均KL-隐私的界。
- 利用詹森不等式和数据扰动的期望,将平均KL-隐私与泛化误差关联起来。
- 通过互信息推导出泛化误差的下界,与使用同一量度的已知上界形成对比。
实验结果
研究问题
- RQ1是否可以为广泛类别的学习算法建立一种弱隐私概念,使其与泛化性等价?
- RQ2平均KL-隐私在最大熵机制中与微分隐私及泛化性之间有何关系?
- RQ3互信息在刻画后验采样算法的泛化误差中起什么作用?
- RQ4平均KL-隐私能否在多个查询中实现自适应组合,同时保持隐私保证?
- RQ5在最大熵采样背景下,互信息与泛化误差之间存在何种相互作用?
主要发现
- 平均KL-隐私与所有最大熵机制的泛化性等价,包括贝叶斯推断和经验风险最小化。
- 本文建立了以互信息表示的泛化误差下界,揭示了互信息在上下界中均起双重作用。
- 平均KL-隐私继承了微分隐私的关键性质,包括多查询组合性与后处理不变性。
- 平均KL-隐私与泛化性的等价性仅对从带损失函数和先验的吉布斯分布中采样的算法成立。
- 自适应组合结果表明,平均KL-隐私在序列查询下得以保持,其界随查询次数线性增长。
- 分析表明,相邻数据集下后验分布之间期望KL散度刻画了最大熵机制的泛化误差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。