Skip to main content
QUICK REVIEW

[論文レビュー] Federated Boosted Decision Trees with Differential Privacy

Samuel Maddock, Graham Cormode|arXiv (Cornell University)|Oct 6, 2022
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

本稿では、Rényi微分プライバシー(RDP)と軽量なセキュアアグリゲーションを用いた、フェデレーテッドな微分プライバシー付き勾配ブースティング決定木(GBDT)フレームワークを提案する。プライバシー予算をリーフ重みに戦略的に割り当て、反復的ヘッセ行列分割を用いたバッチ化ニュートン更新を採用することで、非プライベートモデルと同等の性能を達成しつつ、通信ラウンド数を5〜10回に削減し、性能の損失を最小限に抑える。

ABSTRACT

There is great demand for scalable, secure, and efficient privacy-preserving machine learning models that can be trained over distributed data. While deep learning models typically achieve the best results in a centralized non-secure setting, different models can excel when privacy and communication constraints are imposed. Instead, tree-based approaches such as XGBoost have attracted much attention for their high performance and ease of use; in particular, they often achieve state-of-the-art results on tabular data. Consequently, several recent works have focused on translating Gradient Boosted Decision Tree (GBDT) models like XGBoost into federated settings, via cryptographic mechanisms such as Homomorphic Encryption (HE) and Secure Multi-Party Computation (MPC). However, these do not always provide formal privacy guarantees, or consider the full range of hyperparameters and implementation settings. In this work, we implement the GBDT model under Differential Privacy (DP). We propose a general framework that captures and extends existing approaches for differentially private decision trees. Our framework of methods is tailored to the federated setting, and we show that with a careful choice of techniques it is possible to achieve very high utility while maintaining strong levels of privacy.

研究の動機と目的

  • HE や MPC などの重い暗号技術に依存する既存のフェデレーテッド GBDT メソッドに、形式的なプライバシー保証が欠けている問題に対処すること。
  • 非プライベート GBDT モデルの高い性能とフェデレーテッド環境における強いプライバシー保護の間のギャップを埋めること。
  • 効率的な通信とプライバシー会計をサポートする、微分プライバシー付き GBDT 学習の統合的でモジュラーなフレームワークの開発。
  • プライバシー予算が厳しく制限される条件下で、性能を最大化するための最適な構成(例:スプリット候補、更新タイプ、バッチング)の同定。

提案手法

  • GBDT を 5 つのコンポonent に分解:スプリット候補生成、スプリット選択、リーフ重み最適化、プライバシー予算割り当て、通信戦略。
  • 正確なプライバシー会計を可能にするために、Rényi 微分プライバシー(RDP)を適用し、従来の DP よりもタイトな境界を実現。
  • プライベート環境での安定性と性能向上を図るため、反復的ヘッセ行列(IH)スプリット候補を採用。
  • 通信ラウンド数を削減しながらノイズの影響を緩和するため、バッチ化ニュートン更新を採用。
  • リーフ重みがモデルの性能に与える影響が大きいことから、スプリット意思決定ではなくリーフ重みに微分プライバシーを適用。
  • 重い暗号的オーバーヘッドを回避しつつプライバシーを確保するため、セキュアアグリゲーションと軽量な MPC を組み合わせ。

実験結果

リサーチクエスチョン

  • RQ1微分プライバシー下でノイズに最も感受しやすい GBDT 学習パイプラインのコンponent は何か? また、プライバシー予算はそれらにどのように割り当てられるべきか?
  • RQ2通信ラウンド数を最小限に抑えたフェデレーテッド環境下でも、プライベート GBDT モデルが非プライベートモデルと同等の性能を達成できるか?
  • RQ3スプリット候補手法(例:ランダム、ヒストグラム、反復的ヘッセ行列)の違いが、DP 下でのモデル性能に与える影響は何か?
  • RQ4微分プライバシー付き GBDT 学習において、ニュートン更新と勾配または平均化更新の違いは何か?
  • RQ5モデル更新のバッチ化は、プライベートフェデレーテッド GBDT において通信コストを削減しつつ、モデル性能を損なわないか?

主な発見

  • 反復的ヘッセ行列(IH)スプリット候補と $p=0.25$ のバッチ化ニュートン更新を用いた本手法は、6 つのデータセットにわたり、SOTA ベースラインを常に上回る性能を示し、特に高いプライバシー($\epsilon = 0.1$)条件下で顕著な優位性を示す。
  • バッチサイズ $B=20$ または $B=50$ で更新をバッチ化することで、通信ラウンド数を 5〜10 回に削減しつつ、完全ブースティングと比較して最大で AUC 0.04 の損失に抑えられる。
  • スプリット意思決定ではなくリーフ重みにプライバシー予算を割り当てる方が、リーフ重みが予測精度に与える影響が大きいことから、顕著に高いモデル性能が得られる。
  • 10 回の通信ラウンドでのみ使用しても、非プライベートベースラインと AUC で 0.01 以内の差に抑えられ、優れた性能-プライバシートレードオフを実現。
  • バッチ化($p=0.25$)を施した DP-TR ニュートン IH EBM は、全データセットで平均順位が最も高く、$10T$ ラウンド学習する DP-EBM でさえも上回る。
  • 本フレームワークは、完全ブースティングと比較して通信コストを最大 95% 削減しつつ、性能損失をほとんど生じさせないため、実世界のフェデレーテッド展開に実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。