Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Histogram-Based Gradient Boosted Trees for Federated Learning

Yuya Jeremy Ong, Yi Zhou|arXiv (Cornell University)|Dec 11, 2020
Privacy-Preserving Technologies in Data参考文献 19被引用数 13
ひとこと要約

本稿では、暗号化を用いないパーティ別適応型ヒストグラム集約を用いる、勾配ブースティングツリー向けの新規フェデレーテッドラーニング手法であるParty-Adaptive XGBoost (PAX) を提案する。PAX は、特に非IIDデータ分布下でも、Homo SecureBoost などのセキュアベースラインと比較して、モデル精度が優れており、最大24倍高速に学習を実行できる。これにより、XGBoost は企業向けフェデレーテッドラーニングの展開に実用的になる。

ABSTRACT

Federated Learning (FL) is an approach to collaboratively train a model across multiple parties without sharing data between parties or an aggregator. It is used both in the consumer domain to protect personal data as well as in enterprise settings, where dealing with data domicile regulation and the pragmatics of data silos are the main drivers. While gradient boosted tree implementations such as XGBoost have been very successful for many use cases, its federated learning adaptations tend to be very slow due to using cryptographic and privacy methods and have not experienced widespread use. We propose the Party-Adaptive XGBoost (PAX) for federated learning, a novel implementation of gradient boosting which utilizes a party adaptive histogram aggregation method, without the need for data encryption. It constructs a surrogate representation of the data distribution for finding splits of the decision tree. Our experimental results demonstrate strong model performance, especially on non-IID distributions, and significantly faster training run-time across different data sets than existing federated implementations. This approach makes the use of gradient boosted trees practical in enterprise federated learning.

研究の動機と目的

  • 企業向けフェデレーテッドラーニング環境において、既存のフェデレーテッド勾配ブースティング手法の性能の低さと高い学習遅延を是正すること。
  • 過度な暗号保護に依存せずに、分散データソース間で効率的かつプライバシー保護されたXGBoostモデルの学習を可能にすること。
  • フェデレーテッドラーニング環境に一般的に見られるデータ分布の不均衡や非IID特性に起因する課題を克服すること。
  • Homo SecureBoost などの既存のセキュアブースティングフレームワークに比べ、高い計算コストを伴わないスケーラブルで頑健な代替手法を開発すること。
  • ヒストグラムベースの集約を各パーティに応じて適応可能にすることで、フェデレーテッドツリーモデルにおけるモデル精度と学習速度を向上させること。

提案手法

  • PAX は、意思決定ツリーの分割決定のための局所的データ分布の代理表現を構築するために、パーティ別適応型ヒストグラム集約を用いる。
  • 各パーティは自らのデータ分布に基づいて局所的ヒストグラムを計算し、それらをアグリゲーターに送信する。この際、生データの送信は回避される。
  • アグリゲーターは、各パーティ間のデータ不均衡を考慮した重み付き統合戦略を用いてこれらのヒストグラムを統合する。
  • 本手法は、データ特性と局所的サンプルサイズに応じて、各パーティごとにヒストグラムの解像度とビン分割を動的に適応させる。
  • 分割選択は、集約されたヒストグラム表現上で損失関数(例:対数損失、MSE)を最適化する勾配ブースティングフレームワークを用いて行う。
  • エンドツーエンド暗号化を回避することで、通信および計算のオーバーヘッドを低減しつつ、モデルの有用性を維持する。

実験結果

リサーチクエスチョン

  • RQ1既存のセキュアブースティング手法を上回る精度と学習速度を達成できるフェデレーテッドXGBoostフレームワークを設計できるか?
  • RQ2企業向けフェデレーテッドラーニングで一般的に見られる極端なデータ非IID分布下でも、モデルの性能はどの程度保たれるか?
  • RQ3暗号化なしで、パーティ別適応型ヒストグラム集約が、データ不均衡の処理と通信オーバーヘッドの低減を効果的に行えるか?
  • RQ4暗号保護の欠如が、セキュアベースラインと比較してモデル性能に悪影響を及えるか?
  • RQ5あるパーティが他のパーティと比べて著しく多くのデータを保有する状況でも、本手法は頑健性を維持できるか?

主な発見

  • PAX は、ランダム分割下の Airline データセットで 88% の精度を達成し、極端な不均衡(Partition 5)下では 91% の精度を示した。これは、Homo SecureBoost やロジスティック回帰を上回った。
  • PAX は、バランスの取れた Airline データセットで 49 秒で学習完了したが、Homo SecureBoost は 1177 秒を要し、24 倍の高速化が達成された。
  • 1 つのパーティがデータのたった 1% のみを保有する状況でも、PAX は高い性能を維持した。これは、データ不均衡に対する頑健性を示している。
  • 非IIDなシナリオを含む、すべてのデータ分割方式において、PAX は Homo SecureBoost やロジスティック回帰を上回った。
  • 暗号化に起因するオーバーヘッドが排除されたことで、著しく高速な学習が可能になった一方で、モデル精度は維持または向上した。
  • PAX の適応的ヒストグラム機構により、中央集権的データ調整への依存が低減され、通信による個人情報漏洩のリスクも最小限に抑えられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。