Skip to main content
QUICK REVIEW

[論文レビュー] Online Model Compression for Federated Learning with Large Models

Tien-Ju Yang, Yonghui Xiao|arXiv (Cornell University)|May 6, 2022
Speech Recognition and Synthesis被引用数 4
ひとこと要約

本稿では、オンラインモデル圧縮(OMC)を提案する。OMCは、大規模なニューラルネットワークパラメータを圧縮・量子化形式で保存・送信し、計算時にのみ一時的に展開する、軽量なフレームワークである。OMCは、変数ごとの変換、重み行列専用の量子化、部分的パラメータ量子化を用いることで、完全精度の精度と学習速度を維持しながら、メモリ使用量と通信コストを最大59%まで削減する。

ABSTRACT

This paper addresses the challenges of training large neural network models under federated learning settings: high on-device memory usage and communication cost. The proposed Online Model Compression (OMC) provides a framework that stores model parameters in a compressed format and decompresses them only when needed. We use quantization as the compression method in this paper and propose three methods, (1) using per-variable transformation, (2) weight matrices only quantization, and (3) partial parameter quantization, to minimize the impact on model accuracy. According to our experiments on two recent neural networks for speech recognition and two different datasets, OMC can reduce memory usage and communication cost of model parameters by up to 59% while attaining comparable accuracy and training speed when compared with full-precision training.

研究の動機と目的

  • 大規模モデルを用いたフェデレーテッドラーニングにおける、高いデバイス内メモリ使用量と通信コストを解決すること。
  • モデルの学習中に、モデルパラメータのメモリフットプリントを削減し、モデル精度を損なわないようにすること。
  • フェデレーテッド環境における頻繁な圧縮/展開操作によって引き起こされる学習の遅延を最小限に抑えること。
  • リソース制限のあるエッジデバイスへの、最先端の自動音声認識(ASR)モデルのデプロイを可能にすること。
  • オンラインでオンデマンドに展開可能な圧縮パラメータを用いて、フェデレーテッドラーニングにおける効率的なパラメータ送信と保存を実現すること。

提案手法

  • 完全精度のFP32ではなく、圧縮された浮動小数点形式(例:S1E5M10)でモデルパラメータを保存することで、メモリおよび通信のオーバーヘッドを削減する。
  • 前方伝搬または逆伝搬の実行時にのみ、必要に応じて一時的にパラメータを展開し、使用後は直ちに解放する。
  • 量子化の前段階でパラメータ分布を正規化することで、学習の安定性を高めるために、変数ごとの変換(PVT)を適用する。
  • 最もメモリを消費するコンponents(すなわち、線形層)に限定して圧縮するため、重み行列専用の量子化を用いる。
  • 11ビットなどの低ビット幅で90%のパラメータのみを量子化し、残りの10%は高精度で保持することで、部分的パラメータ量子化(PPQ)を実装する。
  • 可変な指数部および仮数部ビット割り当て(例:S1E3M7、S1E5M7)を用いた浮動小数点量子化により、圧縮効率と誤差制御のバランスを取る。
Figure 1: The illustration of the framework of the proposed online model compression. The cubes with dashed borderlines are transient variables.
Figure 1: The illustration of the framework of the proposed online model compression. The cubes with dashed borderlines are transient variables.

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッドラーニング中のモデルパラメータのオンライン圧縮が、モデル精度を損なわず、デバイス内メモリ使用量を顕著に削減できるか。
  • RQ2変数ごとの変換が、量子化されたフェデレーテッドラーニングの安定性と収束性に与える影響は何か。
  • RQ3重み行列のみ、または一部のパラメータを量子化する場合、ビット幅の低減とモデル性能のトレードオフはどのように変化するか。
  • RQ4低ビット幅で部分的に量子化した場合、高ビット幅の全パラメータ量子化よりも、精度および効率の面で優れているか。
  • RQ5OMCは、完全精度の学習と同等の学習速度を維持しつつ、フェデレーテッドラーニングにおける通信コストをどの程度削減できるか。

主な発見

  • OMCは、完全精度の学習と比較して、モデルパラメータのメモリ使用量と通信コストを最大59%まで削減する。
  • 変数ごとの変換を適用することで、OMCは非ストリーミングConformerモデルにおいて安定した学習収束を達成し、それを行わない場合に見られる精度の低下を回避する。
  • 11ビットフォーマット(S1E3M7)を用いた部分的パラメータ量子化は、13ビットフォーマット(例:S1E5M7、S1E4M8)を用いた全パラメータ量子化よりも低いWERを達成する。
  • 11ビットの部分量子化設定は、テストされたあらゆる13ビットの全量子化設定よりも収束が早く、より低い語誤り率(WER)に到達する。
  • OMCは、頻繁なオンライン圧縮・展開操作が行われても、完全精度の学習と同等の学習速度を維持する。
  • OMCは、メモリおよび通信のオーバーヘッドを効果的に管理することで、エッジデバイス上での大規模ASRモデル(例:非ストリーミングConformer)の学習を可能にする。
Figure 2: The illustration of per-variable transformation. The cubes with dashed borderlines are transient variables.
Figure 2: The illustration of per-variable transformation. The cubes with dashed borderlines are transient variables.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。