Skip to main content
QUICK REVIEW

[论文解读] Privacy-Preserving Gradient Boosting Decision Trees

Qinbin Li, Zhaomin Wu|arXiv (Cornell University)|Nov 11, 2019
Privacy-Preserving Technologies in Data参考文献 29被引用 8
一句话总结

该论文提出 DPBoost,一种差分隐私梯度提升决策树(GBDT)框架,通过基于梯度的数据过滤和几何叶节点裁剪技术收紧敏感度边界,同时采用新颖的两级提升框架,在多棵树之间最优分配隐私预算,从而提升模型准确率。实验表明,DPBoost 在强隐私保障下相比基线模型显著降低测试误差,并与非私有的 GBDT 模型性能相当。

ABSTRACT

The Gradient Boosting Decision Tree (GBDT) is a popular machine learning model for various tasks in recent years. In this paper, we study how to improve model accuracy of GBDT while preserving the strong guarantee of differential privacy. Sensitivity and privacy budget are two key design aspects for the effectiveness of differential private models. Existing solutions for GBDT with differential privacy suffer from the significant accuracy loss due to too loose sensitivity bounds and ineffective privacy budget allocations (especially across different trees in the GBDT model). Loose sensitivity bounds lead to more noise to obtain a fixed privacy level. Ineffective privacy budget allocations worsen the accuracy loss especially when the number of trees is large. Therefore, we propose a new GBDT training algorithm that achieves tighter sensitivity bounds and more effective noise allocations. Specifically, by investigating the property of gradient and the contribution of each tree in GBDTs, we propose to adaptively control the gradients of training data for each iteration and leaf node clipping in order to tighten the sensitivity bounds. Furthermore, we design a novel boosting framework to allocate the privacy budget between trees so that the accuracy loss can be further reduced. Our experiments show that our approach can achieve much better model accuracy than other baselines.

研究动机与目标

  • 解决由于敏感度边界过松和隐私预算分配低效导致的差分隐私 GBDT 模型显著准确率损失问题。
  • 在保持强差分隐私保障的前提下,提升 GBDT 训练中的模型准确率。
  • 应对 GBDT 中敏感度边界过松和多棵树间隐私预算分配不合理的双重挑战。
  • 设计一种可扩展且稳定的训练框架,即使在严格隐私约束下也能保持提升效应。
  • 证明更紧致的敏感度边界和更智能的预算分配策略可使差分隐私 GBDT 达到与非私有 GBDT 模型相当的性能。

提出的方法

  • 提出基于梯度的数据过滤(GDF),在每次迭代中自适应控制梯度,减少目标函数输出范围,从而收紧敏感度边界。
  • 引入几何叶节点裁剪(GLC),利用树结构的几何特性限制叶节点权重,进一步收紧敏感度估计。
  • 设计两级提升框架,结合顺序组合与并行组合,更有效地在多棵树之间分配隐私预算。
  • 使用指数机制在差分隐私下选择最优分裂点,噪声水平基于收紧后的敏感度边界进行校准。
  • 将所提技术集成到改进的 LightGBM 流程中,确保实际效率并保持与现有 GBDT 系统的兼容性。
  • 以混合方式同时应用顺序组合(用于逐棵树训练)和并行组合(用于不相交的数据划分),以最大化隐私预算使用效率。

实验结果

研究问题

  • RQ1如何收紧差分隐私 GBDT 中的敏感度边界,以减少噪声注入并提升模型准确率?
  • RQ2隐私预算分配策略对差分隐私下多棵树 GBDT 模型性能有何影响?
  • RQ3结合顺序与并行隐私组合的混合组合策略能否提升 GBDT 中隐私预算使用的有效性?
  • RQ4在保持强隐私保障的前提下,差分隐私 GBDT 能在多大程度上实现接近非私有 GBDT 模型的性能?
  • RQ5所提方法在不同数据集上,面对不同隐私预算时,其训练时间与稳定性表现如何扩展?

主要发现

  • 当 ε = 1 时,DPBoost 在分类任务上的平均测试误差相比顺序组合基线(SEQ)降低最多达 10%。
  • DPBoost 显著降低了回归任务中的 RMSE,尤其在低隐私预算下表现更优,展现出更强的鲁棒性与准确性。
  • DPBoost 的测试误差方差始终接近于零,表明其在多次运行中具有高度稳定性,而 SEQ 和 PARA 则表现不稳定。
  • 在 5000 棵树和总隐私预算为 500 的情况下,DPBoost 继续降低测试误差,而 PARA 在约 20 棵树后即达到平台期,因每棵树数据不足。
  • DPBoost 每棵树的训练时间在大多数情况下与非私有 GBDT(NP)相当,高维数据集下仅慢 2–3 倍,且在全部 10 个数据集上每棵树训练时间均低于 3 秒。
  • DPBoost 的性能非常接近非私有 LightGBM(NP),证明强隐私保障与高模型质量可在 GBDT 训练中共存。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。