Skip to main content
QUICK REVIEW

[論文レビュー] HAFLO: GPU-Based Acceleration for Federated Logistic Regression

Xiaodian Cheng, Wanhang Lu|arXiv (Cornell University)|Jul 29, 2021
Privacy-Preserving Technologies in Data参考文献 17被引用数 10
ひとこと要約

HAFLO は、一括保存、I/O、計算チューニングを統合することで、同型暗号演算子を最適化する GPU アクcelerated フレームワークである。NVIDIA V100 GPU 上でパフォーマンスが重要な同型暗号演算を高速化することで、HAFLO は CPU に基づく FATE に対して、均一な FLR で最大 88.4× の高速化を達成し、プライバシー保護型機械学習における学習遅延を顕著に短縮する。

ABSTRACT

In recent years, federated learning (FL) has been widely applied for supporting decentralized collaborative learning scenarios. Among existing FL models, federated logistic regression (FLR) is a widely used statistic model and has been used in various industries. To ensure data security and user privacy, FLR leverages homomorphic encryption (HE) to protect the exchanged data among different collaborative parties. However, HE introduces significant computational overhead (i.e., the cost of data encryption/decryption and calculation over encrypted data), which eventually becomes the performance bottleneck of the whole system. In this paper, we propose HAFLO, a GPU-based solution to improve the performance of FLR. The core idea of HAFLO is to summarize a set of performance-critical homomorphic operators (HO) used by FLR and accelerate the execution of these operators through a joint optimization of storage, IO, and computation. The preliminary results show that our acceleration on FATE, a popular FL framework, achieves a 49.9$ imes$ speedup for heterogeneous LR and 88.4$ imes$ for homogeneous LR.

研究の動機と目的

  • 同型暗号(HE)のオーバーヘッドによって引き起こされるフェデレーテッド ロジスティック回帰(FLR)におけるパフォーマンスボトルネックを解消すること。
  • GPU アクセeleration を活用して、FLR における HE 演算の計算遅延を低減すること。
  • データ転送を最小限に抑え、FLR 学習における並列処理を最大化する GPU-CPU 異種システムを設計すること。
  • 既存の FL フレームワーク(例:FATE)と互換性を保ちながら、高スループット実行を可能にすること。
  • GPU アクセelerated 同型暗号演算子のストレージレイアウト、I/O パターン、カーネル実行を最適化すること。

提案手法

  • GPU アクセeleration を対象とする、FLR におけるパフォーマンスが重要な同型暗号演算子(HOs)を要約する。
  • CUDA Toolkit を使用して、同型乗算や加算などの基本的な HE 演算のための GPU 最適化カーネルを実装する。
  • メモリアクセスパターンを改善し、CPU-GPU 間のデータ転送を削減するための集約型データストレージシステムを設計する。
  • 中間結果を GPU メモリにキャッシュする I/O 最適化ワークフローを導入し、デバイス間のデータ移動を最小限に抑える。
  • オープンソースの FATE フレームワークに GPU アクセeleration 层を統合し、既存の FL パイプラインとの互換性を維持する。
  • CPU ベースライン比較のための gmpy2 を使用し、実世界のデータセットを用いてスループットと学習エポックのパフォーマンスをベンチマークする。

実験結果

リサーチクエスチョン

  • RQ1GPU アクセeleration は、フェデレーテッド ロジスティック回帰における同型暗号の計算オーバーヘッドを顕著に低減できるか?
  • RQ2ストレージレイアウトと I/O 管理をどのように最適化すれば、GPU アクセelerated FLR における遅延を最小限に抑えられるか?
  • RQ3異種 FL システムにおいて、同型演算を CPU から GPU にオフロードすることで、どの程度のパフォーマンス向上が達成できるか?
  • RQ4提案されたソリューションは、均一な学習と非均一な学習を含む、さまざまな FLR バリエーションにどのようにスケーリングするか?
  • RQ5GPU アクセelerated フレームワークは、FATE のような既存の FL フレームワークとどの程度の互換性を保っているか?

主な発見

  • HAFLO は、非均一なフェデレーテッド ロジスティック回帰学習において、バニラ FATE に対して 49.9× の高速化を達成した。
  • 計算がより複雑な均一な FLR において、HAFLO は学習エポックの完了において 88.4× の高速化を達成した。
  • GPU に基づく同型乗算演算子は、CPU の対応するものよりもスループットで 100× 以上優れており、特に効率的なモジュラー累乗の処理が要因である。
  • 集約型ストレージと GPU 内の途中結果キャッシュにより、I/O オーバーヘッドが低減され、メモリ帯域幅の利用効率が向上した。
  • FATE フレームワークとの完全な互換性を維持しており、アーキテクチャの変更なしにプラグイン型の加速が可能である。
  • ストレージ、I/O、計算の統合最適化により、プライバシー保護型機械学習ワークロードにおける GPU リソースの効果的利用が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。