Skip to main content
QUICK REVIEW

[論文レビュー] Wyner-Ziv Gradient Compression for Federated Learning

Kai Liang, Huiru Zhong|arXiv (Cornell University)|Nov 16, 2021
Privacy-Preserving Technologies in Data参考文献 26被引用数 9
ひとこと要約

本稿では、通信負荷を低減するために履歴勾配をサイド情報として活用する、フェデレーテッドラーニング向けの新規勾配圧縮手法であるローカル量子化確率的勾配降下法(LQSGD)を提案する。確率的仮定を一切用いずにワイナーツィブ符号化の原則を応用することで、QSGDよりも優れた収束性とテスト精度を達成し、CIFAR-10では0.08%の精度損失、CIFAR-100では3ビット量子化でSGDにほぼ等しい性能を示す。

ABSTRACT

Due to limited communication resources at the client and a massive number of model parameters, large-scale distributed learning tasks suffer from communication bottleneck. Gradient compression is an effective method to reduce communication load by transmitting compressed gradients. Motivated by the fact that in the scenario of stochastic gradients descent, gradients between adjacent rounds may have a high correlation since they wish to learn the same model, this paper proposes a practical gradient compression scheme for federated learning, which uses historical gradients to compress gradients and is based on Wyner-Ziv coding but without any probabilistic assumption. We also implement our gradient quantization method on the real dataset, and the performance of our method is better than the previous schemes.

研究の動機と目的

  • 高次元のモデルパラメータに起因する大規模フェデレーテッドラーニングにおける通信ボトルネックを解消すること。
  • フェデレーテッドトレーニングにおける隣接する確率的勾配の高い相関性を活用し、圧縮効率を向上させること。
  • 確率的仮定を必要とせず、履歴勾配をサイド情報として用いる実用的な勾配圧縮方式を開発すること。
  • 実データセットを用いた実験的検証を通じて、QSGDなどの既存手法と比較しての性能を評価すること。
  • 標準的な仮定の下で勾配量子化誤差および収束速度に対する理論的境界を確立すること。

提案手法

  • クライアント側で履歴勾配をサイド情報として用いる勾配圧縮方式「ローカル量子化確率的勾配降下法(LQSGD)」を提案する。
  • データ分布に関する確率的仮定を必要とせず、勾配圧縮にワイナーツィブ符号化の原則を適応する。
  • 現在の勾配を現在の勾配と履歴勾配の差分に基づいて推定する量子化戦略を採用し、再構成誤差を最小化する。
  • ゼロ平均のノイズを追加することで不偏勾配推定器を導入し、最適化における収束性を保持する。
  • 計算上の非現実性のため、2-ノルムの計算が困難な大規模モデル(例:ResNet18)では実際には勾配の無限大ノルムを用いる。
  • 8クライアントを用いてcpusmall-scale、CIFAR-10、CIFAR-100といった実データセットに本手法を実装し、性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッドラーニングにおける履歴勾配は、効果的にサイド情報として機能し、勾配圧縮効率を向上させることができるか?
  • RQ2限られた通信ビット数の下で、提案手法LQSGDはQSGDに比べて収束速度およびモデル精度で優れているか?
  • RQ3提案された圧縮方式の量子化誤差および収束速度について、どのような理論的保証を提供できるか?
  • RQ4サイド情報の使用により、非サイド情報手法と比較して平均二乗勾配の上界が小さくなるか?
  • RQ5極端な量子化(例:1パラメータあたり2〜3ビット)であっても、高いモデル精度を維持できるか?

主な発見

  • 2ビット量子化のcpusmall-scaleデータセットにおいて、LQSGDは1200イテレーションで収束し、QSGD(1700イテレーション)を上回り、GD性能に匹敵した。
  • 同じデータセットにおいて、LQSGDはQSGDよりも最適モデルパラメータとのユークリッド距離が低く、最適化の安定性が優れていることを示した。
  • CIFAR-10で3ビット量子化を適用した場合、LQSGDは94.53%のテスト精度を達成し、フルプレシジョンのSGD(94.61%)と比較してわずか0.08%の精度損失にとどまった。一方、QSGDは0.42%の損失を示した。
  • CIFAR-100では、LQSGDが76.45%のテスト精度を達成し、SGD(76.44%)と同等であり、QSGD(76.03%)を顕著に上回った。
  • 約70エポックのトレーニング後、LQSGDのテスト精度はCIFAR-10およびCIFAR-100の両方でQSGDを上回り、長期的な最適化性能が優れていることを示した。
  • 理論的分析により、履歴勾配の使用が平均二乗勾配の上界を低減し、標準的な仮定の下で収束速度の保証が得られることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。