[论文解读] Private Learning and Sanitization: Pure vs. Approximate Differential Privacy
本文在私人学习与数据清洗的背景下,比较了纯差分隐私与近似差分隐私,表明通过利用准凹承诺问题的递归算法,近似差分隐私可显著降低样本复杂度,尤其在学习阈值函数和指示函数等任务中。关键结果表明,即使在 (ε,δ)-差分隐私中 δ > 0 的微小值,也能使样本复杂度优于纯 ε-差分隐私。
We compare the sample complexity of private learning [Kasiviswanathan et al. 2008] and sanitization~[Blum et al. 2008] under pure $ε$-differential privacy [Dwork et al. TCC 2006] and approximate $(ε,δ)$-differential privacy [Dwork et al. Eurocrypt 2006]. We show that the sample complexity of these tasks under approximate differential privacy can be significantly lower than that under pure differential privacy. We define a family of optimization problems, which we call Quasi-Concave Promise Problems, that generalizes some of our considered tasks. We observe that a quasi-concave promise problem can be privately approximated using a solution to a smaller instance of a quasi-concave promise problem. This allows us to construct an efficient recursive algorithm solving such problems privately. Specifically, we construct private learners for point functions, threshold functions, and axis-aligned rectangles in high dimension. Similarly, we construct sanitizers for point functions and threshold functions. We also examine the sample complexity of label-private learners, a relaxation of private learning where the learner is required to only protect the privacy of the labels in the sample. We show that the VC dimension completely characterizes the sample complexity of such learners, that is, the sample complexity of learning with label privacy is equal (up to constants) to learning without privacy.
研究动机与目标
- 分析并比较在纯 ε-差分隐私与近似 (ε,δ)-差分隐私下,私人学习与数据清洗的样本复杂度。
- 研究近似差分隐私的松弛是否能为基本的学习与数据清洗任务带来显著低于纯差分隐私的样本复杂度。
- 为私有近似准凹承诺问题开发一种递归框架,以实现高效的私有学习器与数据清洗器。
- 刻画标签私有学习器的样本复杂度,并表明其与非私有学习的复杂度仅相差常数因子,而不同于完整私有学习。
- 为轴对齐矩形等特定概念类建立紧致的样本复杂度界,包括高维空间中的点函数、阈值函数和轴对齐矩形。
提出的方法
- 引入一类称为准凹承诺问题的优化问题家族,其推广了关键的学习与数据清洗任务。
- 设计一种递归算法,通过求解同一问题的更小实例,来私有地近似准凹承诺问题。
- 将递归框架应用于构造高维空间中点函数、阈值函数和轴对齐矩形的高效 (ε,δ)-私有学习器。
- 在学习与数据清洗流程中,使用指数机制与拉普拉斯机制以确保差分隐私。
- 利用集中极限不等式与 VC 理论来控制泛化误差,确保私有假设的正确性。
- 通过将通用私有学习器构造适配至标签私有模型,实现标签隐私与样本隐私的分离,使样本复杂度与 VC 维成比例,而非与 log|C| 成比例。
实验结果
研究问题
- RQ1与纯差分隐私相比,近似差分隐私是否能降低私人学习与数据清洗的样本复杂度?
- RQ2对于点函数与阈值函数等基本概念类,纯差分隐私与近似差分隐私之间的样本复杂度差距是多少?
- RQ3能否利用准凹承诺问题的递归技术来设计高效的私有学习器与数据清洗器?
- RQ4标签私有学习是否能达到与非私有学习相当的样本复杂度?若能,其条件是什么?
- RQ5在 (ε,δ)-差分隐私下,高维空间中轴对齐矩形的私有学习的最紧致样本复杂度是多少?
主要发现
- 在 (ε,δ)-差分隐私下,私人学习与数据清洗的样本复杂度可显著低于纯 ε-差分隐私,即使 δ > 0 极小。
- 对于 d 维空间中的阈值函数,本文构造了一个样本复杂度为 O(1) 的正确 (ε,δ)-私有学习器,而纯差分隐私需要 Ω(d) 个样本。
- 针对准凹承诺问题的递归方法可实现更低的样本复杂度,尤其在点函数与阈值函数上效果显著。
- 标签私有学习器的样本复杂度为 O(VC(C))(相差常数因子),与非私有学习一致,而完整私有学习则需要 O(log|C|) 个样本。
- 一种半私有学习模型——其中分布公开但标签与数据存在性受保护——实现了与完整私有学习相同的样本复杂度 O(VC(C)),且该界是紧致的。
- 本文建立了纯私有学习在 d 维空间中学习阈值函数的下界为 Ω(d),凸显了近似隐私的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。