Skip to main content
QUICK REVIEW

[论文解读] Scalable and Provably Accurate Algorithms for Differentially Private Distributed Decision Tree Learning

Kaiwen Wang, Travis Dick|arXiv (Cornell University)|Dec 19, 2020
Privacy-Preserving Technologies in Data参考文献 24被引用 4
一句话总结

该论文提出 DP-TopDown,一种用于分布式环境的差分隐私、自顶向下决策树学习框架,包含两种实现方式:NoisyCounts(全局噪声聚合)和 LocalRNM(本地优化以减少通信和噪声)。该工作首次为私有决策树提供了可证明的准确度保证,表明在弱学习假设下,随着数据集规模增大,误差迅速下降。

ABSTRACT

This paper introduces the first provably accurate algorithms for differentially private, top-down decision tree learning in the distributed setting (Balcan et al., 2012). We propose DP-TopDown, a general privacy preserving decision tree learning algorithm, and present two distributed implementations. Our first method NoisyCounts naturally extends the single machine algorithm by using the Laplace mechanism. Our second method LocalRNM significantly reduces communication and added noise by performing local optimization at each data holder. We provide the first utility guarantees for differentially private top-down decision tree learning in both the single machine and distributed settings. These guarantees show that the error of the privately-learned decision tree quickly goes to zero provided that the dataset is sufficiently large. Our extensive experiments on real datasets illustrate the trade-offs of privacy, accuracy and generalization when learning private decision trees in the distributed setting.

研究动机与目标

  • 解决在分布式环境中训练高准确度决策树的同时保持强差分隐私保证的挑战。
  • 通过设计高效、私有的分裂机制,克服分布式决策树学习中的隐私-准确度权衡。
  • 为单机和分布式环境下差分隐私自顶向下决策树学习提供理论准确度保证。
  • 通过实证表明,私有决策树在某些情况下(尤其是小样本或噪声数据集)的泛化能力优于非私有模型。

提出的方法

  • 提出 DP-TopDown,一类基于 TopDown 框架的差分隐私决策树算法家族,使用一个名为 PrivateSplit 的私有子程序来近似最优分裂。
  • 实现 NoisyCounts:每个数据持有者发布拉普拉斯噪声化的类别计数,这些计数被聚合以选择分裂点,从而在高噪声和高通信成本下确保差分隐私。
  • 提出 LocalRNM:一种启发式方法,在通信前对每个数据持有者进行本地优化,与 NoisyCounts 相比显著减少了噪声和通信量。
  • 应用衰减预算分配策略,动态在内部节点分裂和叶节点标记之间分配隐私预算,通过优先考虑关键决策来提高准确度。
  • 使用熵作为分裂标准,并应用指数机制或拉普拉斯机制,确保在分裂选择过程中满足差分隐私。
  • 基于弱学习假设和理论边界,推导出准确度保证,表明在数据集规模增大时,泛化误差收敛至零。

实验结果

研究问题

  • RQ1我们能否设计一种差分隐私、分布式的决策树学习算法,在确保强隐私保证的同时保持高准确度?
  • RQ2在分布式决策树学习中,内部分裂与叶节点标记之间的隐私预算分配如何影响最终模型的准确度?
  • RQ3在贪心分裂过程中注入噪声是否能改善泛化性能,特别是在非私有模型发生过拟合的情况下?
  • RQ4在单机和分布式环境下,我们能否在弱学习假设下,理论化地界定差分隐私决策树的泛化误差?
  • RQ5在分布式私有决策树学习中,通信成本与噪声水平之间存在何种权衡?本地优化能否缓解这一权衡?

主要发现

  • DP-TopDown 首次为单机和分布式环境下的差分隐私自顶向下决策树学习提供了可证明的准确度保证,且随着数据集规模增大,误差收敛至零。
  • 在多个真实世界数据集(Adult、Bank、Creditcard、Skin)上,LocalRNM 在测试准确度方面优于 NoisyCounts,这是由于通过本地优化显著减少了噪声和通信量。
  • 在 CTR 数据集上,对于某些隐私参数,私有算法的测试准确度高于非私有基线模型,表明噪声注入有助于在贪心学习中逃离较差的局部最优解。
  • 更大的训练数据集始终带来更高的测试准确度和更低的方差,验证了理论预期,并表明私有学习中数据多样性具有优势。
  • 衰减预算分配策略通过将更多隐私预算分配给关键决策,提升了性能,且将 LeafPrivacyFraction 固定为 0.5 在所有实验中均能获得稳定结果。
  • 训练准确度随数据集规模增大而提高,即使较小数据集更容易发生过拟合,这表明私有学习受益于数据规模和噪声正则化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。