[論文レビュー] The Future of Large Language Model Pre-training is Federated
本論文は、データ豊富な機関が中央集権的なデータセンターを必要とせずに、分散型で協働的に大規模言語モデル(LLM)を事前学習するためのフェデレーテッドラーニング(FL)フレームワークを提案する。これは、非均質なFL環境下で、初めて10億パラメータ規模のLLMを成功裏に訓練した。性能は中央集権的学習と競合するものであり、計算リソースおよびデータリソースへのアクセスの民主化を実現する。
Generative pre-trained large language models (LLMs) have demonstrated impressive performance over a wide range of tasks, thanks to the unprecedented amount of data they have been trained on. As established scaling laws indicate, LLMs' future performance improvement depends on the amount of computing and data sources they can leverage for pre-training. Federated learning (FL) has the potential to unleash the majority of the planet's data and computational resources, which are underutilized by the data-center-focused training methodology of current LLM practice. Our work presents a robust, flexible, reproducible FL approach that enables large-scale collaboration across institutions to train LLMs. We propose a scalable deployment system called Photon to enable the investigation and development of this new training paradigm for LLM pre-training. We show that Photon can be used by organizations interested in collaborating with their private data sources and computational resources for pre-training LLMs with billions of parameters. This paradigm would mobilize more computational and data resources while matching or potentially exceeding centralized performance. We further show the effectiveness of the federated training scales with model size and present our approach for training billion-scale federated LLMs using limited resources. Thus far, we have used Photon to train LLM models to the size of 7B parameters and anticipate larger models being completed in the near future. Finally, we show that LLM training is highly resilient to the classical challenges of federated statistical and hardware heterogeneity. Furthermore, we show that convergence is robust to partial participation, opening the avenue for compute-efficient collaborative training. Photon will help data-rich actors to become the protagonists of LLMs pre-training instead of leaving the stage to compute-rich actors alone.
研究の動機と目的
- 中央集権的LLM事前学習における増大するデータおよび計算のボトル neck を解消するため、世界中に散在する未利用のデータおよび計算リソースを活用すること。
- 計算能力や接続性に制限があっても、生データを共有することなく、データ豊富な機関がLLM事前学習に貢献できるようにすること。
- フェデレーテッドラーニングが、10億パラメータ規模のモデルにまでスケーリング可能であり、中央集権的学習と同等の性能を達成できることを示すこと。
- 非均質なクライアントとプライベートデータをサポートする、再現可能でオープンソースのシステムを構築すること。
- より大きなフェデレーテッドモデルは、従来の仮定とは逆に、より簡単に収束するのかを検証すること。
提案手法
- 複数のクライアントが異なるハードウェアを備える環境で分散型学習を実行するために、オープンソースのFLフレームワーク「Flower」を採用する。
- 最適化の安定化と非均質ノード間のクライアント勾配の整合性を高めるために、モーメンタムを用いたFedAvgを採用する。
- 通信負荷を低減し収束を改善するために、局所的SGDに重み減衰、クリッピング、学習率スケジューリングを適用する。
- 再現性を確保するため、完全に透明なハイパーパrameterおよび設定を含むトレーニングレシピを実装する。
- 収束状態の監視および過学習の検出のため、サーバー側でのモデル検証とパープレキシティの追跡を実施する。
- 直接的なデータ共有なしにモデルアグリゲーションを実現し、プライバシーを設計段階から確保する。
実験結果
リサーチクエスチョン
- RQ1限られたハードウェアと非均質なクライアントを前提とした場合でも、フェデレーテッドラーニングが中央集権的学習と同等のLLM事前学習性能を達成できるか?
- RQ2予想に反して、フェデレーテッド学習のスケーラビリティは、モデルサイズの増大とともに向上するのか?
- RQ3フェデレーテッド最適化の過程で、クライアントおよびサーバーのモデルノルムはどのように変化するか? これにより収束ダイナミクスの理解が深まるか?
- RQ4FLにおけるモデルアveragingは、クライアント勾配のノイズをどれほど低減し、正則化効果を発揮するか?
- RQ5中央集権化せずに、プライベートで非公開のデータソースをLLM事前学習に効果的に活用できるか?
主な発見
- 標準的なクラウドプロバイダーの1〜8GPUノードのみを用いて、非均質なフェデレーテッド環境下で、初めて10億スケールのLLMの事前学習に成功した。
- フェデレーテッド学習は、バリデーションパープレキシティの観点で中央集権的学習と同等またはそれを上回る性能を達成した。サーバーのモデルはクライアントのスパイクをソフトな上限として示した。
- より大きなフェデレーテッドモデル(例:3.5億パラメータ)は、予想に反し、より小さなモデルよりもクライアント間で共通の解に到達しやすかった。
- FedAvgの疑似勾配ノルムは、局所クライアント勾配よりも速やかに減衰した。これは、平均化が矛盾するかノイズの多い最適化方向を相殺していることを示している。
- クライアントとサーバーのモデルの相互作用から、サーバーのモデルは初期段階でクライアントのノルムを抑制していたが、後に安定化し、同じノルムに収束した。これは、成功裏な共通認識形成を示している。
- 本システムは、巨大な計算インfraを備えていなくても、データ豊富な主体がフェデレーテッドネットワークに参加することで、LLM事前学習の中心的役割を果たせることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。