Skip to main content
QUICK REVIEW

[論文レビュー] FedXGBoost: Privacy-Preserving XGBoost for Federated Learning

Nhan Khanh Le, Yang Liu|arXiv (Cornell University)|Jun 20, 2021
Privacy-Preserving Technologies in Data参考文献 18被引用数 9
ひとこと要約

FedXGBoostは、暗号化手法よりも低いオーバーヘッドで損失のない精度を達成する2つのプライバシー保護プロトコル——FedXGBoost-SMMとFedXGBoost-LDP——を導入する。分割スコア計算を安全な行列積に再定式化し、偽装性を強化することで、FedXGBoost-SMMは精度を損なわずにプライバシーを確保する。一方、FedXGBoost-LDPは局所的微分プライバシーとノイズ摂動を用いて実用的な展開を可能にする。

ABSTRACT

Federated learning is the distributed machine learning framework that enables collaborative training across multiple parties while ensuring data privacy. Practical adaptation of XGBoost, the state-of-the-art tree boosting framework, to federated learning remains limited due to high cost incurred by conventional privacy-preserving methods. To address the problem, we propose two variants of federated XGBoost with privacy guarantee: FedXGBoost-SMM and FedXGBoost-LDP. Our first protocol FedXGBoost-SMM deploys enhanced secure matrix multiplication method to preserve privacy with lossless accuracy and lower overhead than encryption-based techniques. Developed independently, the second protocol FedXGBoost-LDP is heuristically designed with noise perturbation for local differential privacy, and empirically evaluated on real-world and synthetic datasets.

研究の動機と目的

  • 既存の暗号化手法による高いオーバーヘッドのため、フェデレーテッド学習における効率的でプライバシー保護型のXGBoostの欠如に対処する。
  • 同型暗号化よりも計算コストを低減しつつ、プライバシーを保持し精度を損なわない安全な行列積ベースのプロトコル(FedXGBoost-SMM)を開発する。
  • 実世界および合成データセット上で妥当な性能を得られる、ヒューリスティックな局所的微分プライバシープロトコル(FedXGBoost-LDP)を設計する。
  • 安全な行列積および同型暗号化におけるプライバシー漏洩リスクを特定し、強化された偽装性を導入してこれを緩和する。
  • 垂直分割されたフェデレーテッド環境において、モデル性能を損なわずにプライバシー保護型XGBoostの実現可能性と有用性を示す。

提案手法

  • カテゴリカル行列と勾配ベクトル間の安全な行列積(SMM)問題に、XGBoostの分割スコア評価を定式化する。
  • 極めて強い好奇心を持つ参加者ですら真の行列要素を推定できないように、SMMプロトコルに偽装性メカニズムを統合する。
  • XGBoostの目的関数の一次近似を適用し、ノイズ付き勾配の不偏推定器を導出することで、正確な分割スコア計算を可能にする。
  • 局所的微分プライバシーを用い、勾配とヘッセ行列にノイズを摂動させる手法を採用し、個人データ寄与の保護を実現する。
  • 各クライアントが異なる特徴量を保持する垂直データ分割を採用し、生データを共有せずに協調学習を可能にする。
  • プライバシー保護型プロトコルをフェデレーテッドXGBoost学習パイプラインに統合し、モデル精度を維持するとともに微分プライバシーの保証を達成する。

実験結果

リサーチクエスチョン

  • RQ1安全な行列積を強化することで、フェデレーテッドXGBoostにおいて高いプライバシー保証を達成しつつ、精度の損失や高い計算コストを伴わずに実現可能か?
  • RQ2XGBoostに適用された既存の安全な行列積および同型暗号化プロトコルにおける根本的なプライバシー漏洩リスクは何か? そして、それらはどのように緩和できるか?
  • RQ3提案されたFedXGBoost-LDPプロトコルは、実世界および合成データセットにおいて、モデルの有用性とプライバシーのトレードオフの観点でどの程度の性能を示すか?
  • RQ4FedXGBoost-SMMのような線形代数ベースのアプローチは、フェデレーテッドXGBoostにおいて、効率性と精度の両面で暗号化手法を上回れるか?
  • RQ5勾配にノイズを注入した状況下で、XGBoost目的関数の一次近似は、分割スコア推定の不偏性をどの程度維持できるか?

主な発見

  • FedXGBoost-SMMは、分割スコア計算を安全な行列積に再定式化し、偽装性を強化することで、同型暗号化よりもオーバーヘッドを低減しながら損失のないモデル精度を達成する。
  • 強化されたSMMプロトコルは、カテゴリカルな要素であっても、極めて強い好奇心を持つ参加者ですら真の行列値を高い確率で推定できないようにする。
  • FedXGBoost-LDPは、局所的微分プライバシーとノイズ摂動を用いた実用的ヒューリスティックを提供し、実世界および合成データセットで妥当なモデル有用性を達成する。
  • XGBoost目的関数の一次近似により、勾配とヘッセ行列にノイズを注入した状況下でも、分割スコア推定の不偏性が維持され、モデル性能が損なわれない。
  • ノイズ下での分割スコア推定器の分散は解析的に境界付けられており、分散が増加するものの推定器は不偏のまま保たれる。
  • 実験的評価により、FedXGBoost-LDPが実世界データセットにおいても競争力ある性能を維持することが確認され、XGBoostを用いたプライバシー保護型フェデレーテッド学習の実用的妥当性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。