Skip to main content
QUICK REVIEW

[論文レビュー] Privacy-Preserving Gradient Boosting Decision Trees

Qinbin Li, Zhaomin Wu|arXiv (Cornell University)|Nov 11, 2019
Privacy-Preserving Technologies in Data参考文献 29被引用数 8
ひとこと要約

本稿では、勾配ベースのデータフィルタリングと幾何的リーフクリッピングを用いて感度バウンドを厳密にすることで、モデルの精度を向上させる、プライバシー保護型勾配ブースティング決定木(GBDT)フレームワークであるDPBoostを提案する。また、プライバシー予算を複数の木に最適に割り当てるための新規二段階ブースティングフレームワークを採用している。実験の結果、DPBoostはベースラインと比較して顕著に低いテスト誤差を達成し、強いプライバシー保証のもとで非プライベートGBDTモデルと同等の性能を発揮することが示された。

ABSTRACT

The Gradient Boosting Decision Tree (GBDT) is a popular machine learning model for various tasks in recent years. In this paper, we study how to improve model accuracy of GBDT while preserving the strong guarantee of differential privacy. Sensitivity and privacy budget are two key design aspects for the effectiveness of differential private models. Existing solutions for GBDT with differential privacy suffer from the significant accuracy loss due to too loose sensitivity bounds and ineffective privacy budget allocations (especially across different trees in the GBDT model). Loose sensitivity bounds lead to more noise to obtain a fixed privacy level. Ineffective privacy budget allocations worsen the accuracy loss especially when the number of trees is large. Therefore, we propose a new GBDT training algorithm that achieves tighter sensitivity bounds and more effective noise allocations. Specifically, by investigating the property of gradient and the contribution of each tree in GBDTs, we propose to adaptively control the gradients of training data for each iteration and leaf node clipping in order to tighten the sensitivity bounds. Furthermore, we design a novel boosting framework to allocate the privacy budget between trees so that the accuracy loss can be further reduced. Our experiments show that our approach can achieve much better model accuracy than other baselines.

研究の動機と目的

  • 感度バウンドの緩さとプライバシー予算配分の非効率性による、プライバシー保護型GBDTモデルにおける顕著な精度損失を是正すること。
  • 強い微分プライバシー保証を維持しつつ、GBDT学習におけるモデル精度を向上させること。
  • GBDTにおける複数の木にわたる感度バウンドの緩さと、非効率なプライバシー予算配分という二重の課題に取り組むこと。
  • 厳密なプライバシー制約下でもブースティング効果を保つ、スケーラブルで安定した学習フレームワークを設計すること。
  • 感度バウンドの厳密化と、より知的な予算配分により、非プライベートGBDTモデルと同等の性能を達成できるかどうかを実証すること。

提案手法

  • 各イテレーションにおいて勾配を適応的に制御することで、損失関数出力の範囲を縮小し、感度バウンドを厳密にする勾配ベースのデータフィルタリング(GDF)を提案する。
  • 木構造の幾何的性質を用いてリーフ重みを制限することで、感度推定値をさらに厳密にする幾何的リーフクリッピング(GLC)を導入する。
  • 木ごとのプライバシー予算をより効果的に割り当てるために、逐次的および並列的合成を組み合わせた二段階ブースティングフレームワークを設計する。
  • 微分プライバシー下で最適な分割を選択するための指数機構を用い、厳密化された感度バウンドに基づいてノイズを調整する。
  • 実用的な効率性と既存のGBDTシステムとの互換性を確保するため、改良型LightGBMパイプラインに提案手法を統合する。
  • 木ごとの学習に逐次合成を、互いに disjoint なデータ分割に並列合成を適用するハイブリッドなアプローチを採用し、プライバシー予算の使用効率を最大化する。

実験結果

リサーチクエスチョン

  • RQ1プライバシー保護型GBDTにおける感度バウンドをどのように厳密化すれば、ノイズの注入を減らし、モデル精度を向上させられるか?
  • RQ2プライバシー予算配分戦略が、微分プライバシー下での多木GBDTモデルの性能に与える影響は何か?
  • RQ3逐次的および並列的プライバシー合成を組み合わせたハイブリッド合成戦略は、GBDTにおけるプライバシー予算使用の効果性を向上させ得るか?
  • RQ4強いプライバシー保証を維持しつつ、プライバシー保護型GBDTが非プライベートGBDTモデルにどれほど近い性能を達成できるか?
  • RQ5提案手法は、多様なデータセットおよびさまざまなプライバシー予算の下で、学習時間と安定性の観点からどの程度スケーラブルか?

主な発見

  • ε = 1 の条件下で、分類タスクにおいてDPBoostは逐次合成ベースライン(SEQ)と比較して平均して最大10%低いテスト誤差を達成した。
  • 回帰タスクにおいても、DPBoostは特に低プライバシー予算下でRMSEを顕著に低減し、優れたロバストネスと精度を示した。
  • DPBoostのテスト誤差の分散は、常にほぼゼロに近い水準を維持しており、SEQ や PARA とは異なり、実行間での安定性が高く保証された。
  • 5000本の木と合計プライバシー予算500の条件下でも、DPBoostはテスト誤差を継続的に低下させたが、PARAは約20本の木を過ぎるとデータ1本あたりの情報量が不足し、誤差が頭打ちとなった。
  • DPBoostの1木あたりの学習時間は、ほとんどのケースで非プライベートGBDT(NP)と同等であり、高次元データセットでは2〜3倍の遅延にとどまり、全10のデータセットにおいて1木あたり3秒以内に収まった。
  • DPBoostは非プライベートLightGBM(NP)と非常に近い性能を達成しており、GBDT学習において強いプライバシーと高いモデル品質が両立可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。