[论文解读] Limits of Private Learning with Access to Public Data
本文在可访问公共未标记数据的前提下,建立了私有学习的基本极限。它表明,任何 VC 维为 $d$ 的假设类都可以通过 $O(d/\alpha)$ 个公共样本和 $O(d/\alpha^2)$ 个私有标记样本实现广义学习,相较于标准私有学习,公共样本复杂度实现了二次改进,即使公共数据为未标记数据亦成立。这一结果几乎匹配了具有无限 Littlestone 维度的类的下界。
We consider learning problems where the training set consists of two types of examples: private and public. The goal is to design a learning algorithm that satisfies differential privacy only with respect to the private examples. This setting interpolates between private learning (where all examples are private) and classical learning (where all examples are public). We study the limits of learning in this setting in terms of private and public sample complexities. We show that any hypothesis class of VC-dimension $d$ can be agnostically learned up to an excess error of $α$ using only (roughly) $d/α$ public examples and $d/α^2$ private labeled examples. This result holds even when the public examples are unlabeled. This gives a quadratic improvement over the standard $d/α^2$ upper bound on the public sample complexity (where private examples can be ignored altogether if the public examples are labeled). Furthermore, we give a nearly matching lower bound, which we prove via a generic reduction from this setting to the one of private learning without public data.
研究动机与目标
- 理解在可访问公共数据的前提下,不同差分隐私学习中私有与公共样本复杂度之间的权衡。
- 确定在广义学习中实现非平凡隐私-准确率权衡所需的最少公共样本数量。
- 为纯和近似半私有学习建立公共样本复杂度的近乎紧致上下界。
- 刻画公共数据在何种条件下能实现高效私有学习,特别是与 VC 维和 Littlestone 维等组合参数的关系。
提出的方法
- 提出一种从半私有学习到无公共数据标准私有学习的新颖约化方法,从而实现下界转移。
- 引入一种技术,通过将公共数据视为真实数据分布的代理,利用半私有学习器模拟私有学习器。
- 使用混合分布构造方法,其中以概率 $1-p$ 标签为均匀随机,将真实分布下的泛化误差与噪声混合分布下的误差关联起来。
- 应用集中不等式和概率论论证,界定在有和无公共数据的分布之间误差概率的差异。
- 利用分布距离(总变差距离)的概念,证明当公共数据与真实数据分布距离较小时,可实现有效学习。
- 利用 Littlestone 维度作为关键组合参数,推导近似半私有学习的下界。
实验结果
研究问题
- RQ1公共数据能否显著降低差分隐私学习中的私有样本复杂度?
- RQ2对于任意 VC 类,实现高效私有学习所需的最少公共样本数量(标记或未标记)是多少?
- RQ3Littlestone 维度如何影响近似半私有学习中公共样本复杂度的下界?
- RQ4公共数据的存在能否绕过对简单概念类(如阈值类)在私有学习中已知的不可能性结果?
- RQ5是否存在基于假设类组合性质的纯半私有可学习性的二分法?
主要发现
- 任何 VC 维为 $d$ 的假设类都可以通过 $O(d/\alpha)$ 个公共样本和 $O(d/\alpha^2)$ 个私有标记样本实现广义学习,即使公共样本为未标记数据亦成立。
- 该公共样本复杂度相较于所有数据均为私有的标准 $O(d/\alpha^2)$ 边界实现了二次改进,体现了显著的效率提升。
- 为近似半私有学习建立了几乎匹配的下界 $\Omega(1/\alpha)$ 个公共样本,即使公共数据为标记数据亦成立。
- 该下界对具有无限 Littlestone 维度的类(如一维阈值类)成立,表明在此情况下上界具有紧致性。
- 建立了纯半私有学习的二分法:当且仅当假设类可在无公共数据的情况下被纯私有学习器学习时,其才是纯半私有可学习的。
- 该约化技术表明,任何半私有学习器均可用于构造私有学习器,从而实现从标准私有学习设定中转移下界。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。