Skip to main content
QUICK REVIEW

[論文レビュー] Bitwidth Heterogeneous Federated Learning with Progressive Weight Dequantization

Jaehong Yoon, Geon Park|arXiv (Cornell University)|Feb 23, 2022
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

本稿では、計算および記憶に異なるビット幅を使用するクライアントを想定した、ビット幅異種型フェデレーテッドラーニング(BHFL)のためのフレームワークであるProWDを提案する。ProWDは、サーバーに学習可能な段階的デキュアンタイザを設け、低ビット幅クライアント重みを高精度表現に再構成するとともに、選択的集約を組み合わせることで、相互運用性を向上させ、ビット幅の異種性下でもCIFAR-10およびMNISTでベースラインより顕著に優れた性能を達成する。

ABSTRACT

In practical federated learning scenarios, the participating devices may have different bitwidths for computation and memory storage by design. However, despite the progress made in device-heterogeneous federated learning scenarios, the heterogeneity in the bitwidth specifications in the hardware has been mostly overlooked. We introduce a pragmatic FL scenario with bitwidth heterogeneity across the participating devices, dubbed as Bitwidth Heterogeneous Federated Learning (BHFL). BHFL brings in a new challenge, that the aggregation of model parameters with different bitwidths could result in severe performance degeneration, especially for high-bitwidth models. To tackle this problem, we propose ProWD framework, which has a trainable weight dequantizer at the central server that progressively reconstructs the low-bitwidth weights into higher bitwidth weights, and finally into full-precision weights. ProWD further selectively aggregates the model parameters to maximize the compatibility across bit-heterogeneous weights. We validate ProWD against relevant FL baselines on the benchmark datasets, using clients with varying bitwidths. Our ProWD largely outperforms the baseline FL algorithms as well as naive approaches (e.g. grouped averaging) under the proposed BHFL scenario.

研究の動機と目的

  • クライアントが計算およびメモリに異なるビット幅を使用する場合のモデル性能の低下という課題に対処する。
  • 性能低下の2つの主要因を同定する:異種ビット幅重みの集約による分布シフト、および低ビット幅モデルの表現力の制限。
  • 均一なクライアント仕様を必要としない、多様なハードウェアのビット幅をサポートする実用的なFLフレームワークを開発する。
  • サーバーに学習可能な段階的デキュアンタイザを設け、低ビット幅クライアント更新から高精度モデルを回復可能にする。
  • 異なるビット幅間で互換性を高め、収束を改善するため、重み成分を適合性に応じて選択的に集約する。

提案手法

  • クライアントが8ビット、4ビット、または3値など、異なるビット幅で動作する新しいFL設定として、ビット幅異種型フェデレーテッドラーニング(BHFL)を導入する。
  • 中央サーバーに、段階的デキュアンタイザブロックを逐次適用することで、低ビット幅重みを高精度表現に再構成する。
  • 不適合な低ビット幅重み成分を事前に同定・除外することで、重み成分を適合性に応じて選択的に集約する戦略を実装する。
  • 再構成された重みとフル精度重みの差を最小化するため、再構成損失を用いてデキュアンタイザをエンドツーエンドで学習する。
  • アップリンクおよびダウンリンク通信において、クライアント固有のビット幅を活用し、標準化を要しない異種ハードウェアの参加を可能にする。
  • CIFAR-10およびMNISTといった標準FLベンチマークに、8ビット、4ビット、3値重みを用いるクライアントを適用し、性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1均一なハードウェア仕様を要件としないで、異なるビット幅を持つクライアントを効果的に処理できるフェデレーテッドラーニングシステムは構築可能か?
  • RQ2ビット幅の異種性は、フェデレーテッドラーニングにおけるモデル収束および性能にどのように影響を与えるか?
  • RQ3サーバーに設けた段階的デキュアンタイザは、低ビット幅クライアント更新から高精度重みを回復可能か?
  • RQ4重み成分の選択的集約は、ビット幅異種型FLにおける相互運用性および性能を向上させるか?
  • RQ5ビット幅の異種性下で、ProWDは既存の量子化に配慮した手法やベースラインFL手法を上回るか?

主な発見

  • CIFAR-10およびMNISTにおいて、ビット幅の異種性下でProWDはFedAvg、FedProx、FedPAQ、FedCOMGATEを顕著に上回る精度を達成し、特に高ビット幅クライアントが関与する状況で顕著な優位性を示す。
  • 図6の段階的重み分布可視化により、段階的デキュアンタイザが3値および低ビット幅重みをフル精度表現に成功して再構成していることが確認された。
  • 図7のコサイン距離分析から、ProWDが異なるビット幅間で十分な重み多様性を維持しており、低ビット幅分布への分布シフトを防いでいることが裏付けられた。
  • ProWDにおける選択的集約により、不適合な重み成分による性能低下リスクが低減され、相互運用性が向上した。
  • 表5および図4から、QPCベース手法と比較して、ProWDはより優れた知識伝達とローカル適応を実現していることが示された。
  • 実験結果から、クライアントが8ビット、4ビット、または3値重みを使用する状況でも、ProWDが高い性能を維持することが実証され、ビット幅の異種性に対する頑健性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。