Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Split-Mix Federated Learning for On-Demand and In-Situ Customization

Junyuan Hong, Haotao Wang|arXiv (Cornell University)|Mar 18, 2022
Privacy-Preserving Technologies in Data被引用数 6
ひとこと要約

本稿では、異種のフェデレーテッドラーニング環境において、モデルサイズと耐性のオンデマンドかつイン・サイトでのカスタマイズを可能にする、新しいフレームワーク「Split-Mixフェデレーテッドラーニング」を提案する。幅と耐性レベルが異なる複数の基本サブネットワークを別々に訓練・集約することで、推論時に動的にモデルを構成可能であり、従来の手法と比較して通信・ストレージ・推論の面で優れた効率性を達成する。リソース制約下でも精度の低下が最小限に抑えられる。

ABSTRACT

Federated learning (FL) provides a distributed learning framework for multiple participants to collaborate learning without sharing raw data. In many practical FL scenarios, participants have heterogeneous resources due to disparities in hardware and inference dynamics that require quickly loading models of different sizes and levels of robustness. The heterogeneity and dynamics together impose significant challenges to existing FL approaches and thus greatly limit FL's applicability. In this paper, we propose a novel Split-Mix FL strategy for heterogeneous participants that, once training is done, provides in-situ customization of model sizes and robustness. Specifically, we achieve customization by learning a set of base sub-networks of different sizes and robustness levels, which are later aggregated on-demand according to inference requirements. This split-mix strategy achieves customization with high efficiency in communication, storage, and inference. Extensive experiments demonstrate that our method provides better in-situ customization than the existing heterogeneous-architecture FL methods. Codes and pre-trained models are available: https://github.com/illidanlab/SplitMix.

研究の動機と目的

  • デバイスの非均一性や環境の変化に起因する、フェデレーテッドラーニングにおける動的かつランタイムでのリソースおよび耐性要件の課題に対処すること。
  • 再訓練を伴わず、高いトレーニング・ストレージ・推論コストを負担せずに、イン・サイトかつオンデマンドでのモデルサイズおよび敵対的耐性のカスタマイズを可能にすること。
  • 従来の異種アーキテクチャフェデレーテッドラーニング手法の限界、例えば大規模モデルにおける不十分な訓練や非IIDデータ下での一般化性能の低さを克服すること。
  • さまざまなハードウェアおよび予算制約を持つクライアント間で、効率的な知識移転とモデル構成を可能にするスケーラブルでモジュラーなフレームワークの開発

提案手法

  • 本手法は、フル幅モデルを幅(例:×0.25、×0.5)と耐性レベルが異なる複数の基本サブネットワークに分割し、各クライアントで別々に訓練する。
  • 各基本モデルはローカルデータ上で完全に訓練され、知識の完全な活用が保証され、大規模モデルで一般的な不十分な訓練問題が軽減される。
  • 推論時に選択された基本モデルを重み付き集約することで、デバイスの制約に応じた動的な適応が可能なカスタマイズモデルが構成される。
  • 一般化性能の向上を目的に、耐性と幅の両方を同時に最適化するための新規な微分可能アーキテクチャ探索(DBNベース)手法を導入する。
  • クライアントは、全基本モデルがすべてのデバイスで訓練されるように保証するためのサンプリング戦略(アルゴリズム2)を用いる。これにより、知識の多様性とモデルの安定性が向上する。
  • 幅と耐性の両方のカスタマイズを同時にサポートし、1つの条件変数により、トレードオフを滑らかに調整可能である。

実験結果

リサーチクエスチョン

  • RQ1再訓練を伴わず、フェデレーテッドラーニングフレームワークが、リソース制約下でもオンデマンドかつイン・サイトでのモデルサイズと耐性のカスタマイズを可能にするか。
  • RQ2リソース予算が異なる異種クライアント間で、知識を効率的に共有・集約する方法は何か。
  • RQ3別々に訓練された基本サブネットワークは、リソース制約下で共同で訓練された大規模モデルと比較して、より優れた一般化性能と低い精度損失を達成できるか。
  • RQ4本手法のSplit-Mix戦略は、既存の異種アーキテクチャフェデレーテッドラーニング手法と比較して、精度、通信、推論効率の面でどのように差をつけるか。
  • RQ5モデル幅と敵対的耐性を動的に調整する際、本手法がどれほど耐性と精度を維持できるか。

主な発見

  • Split-Mixは、HeteroFLやFedAvgと比較して、リソース制約下でも顕著に優れたイン・サイトカスタマイズを実現し、精度の低下が少ない。
  • 非IIDデータ環境下では、HeteroFLと比較して最大3.5%の精度損失低減を達成し、特にクリップアートやペインティングといった、モデルの不十分な訓練が顕著に顕在する分野で顕著である。
  • Split-Mixは、全クライアントで全基本モデルが完全に訓練されることを保証し、各ドメインで100%のパラメータ利用率を達成する。これに対してHeteroFLは、最大60%のパラメータが未訓練のまま残る。
  • 提案されたSplit-Mix+DAT拡張は、FedAvg+OATと比較して滑らかな耐性-標準精度トレードオフを実現し、収束問題がなく、FedAvg+ATベースラインを上回る性能を示す。
  • カスタマイズ可能な幅のシナリオでは、Split-Mix+DATは幅が増加するにつれて、耐性精度および標準精度の両方を向上させ、効果的かつ安定した統合的カスタマイズを示している。
  • 本フレームワークは、複数のフルモデルを保存・再訓練する必要がなくなるため、通信およびストレージコストを削減し、効率的なオンデバイスモデル切り替えを可能にしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。