Skip to main content
QUICK REVIEW

[論文レビュー] FLoRA: Federated Fine-Tuning Large Language Models with Heterogeneous Low-Rank Adaptations

Ziyao Wang, Zanming Shen|arXiv (Cornell University)|Sep 9, 2024
Topic Modeling被引用数 4
ひとこと要約

FLoRAは、異種の低ランクアダプタ(LoRA)を用いた大規模言語モデルのフェデレーテッドファインチューニングのためのノイズフリーでスタッキングベースの集約手法を提案する。ローカルなLoRA行列を平均化するのではなくスタッキングすることで、数学的集約誤差を排除し、クライアント間での異なるLoRAランクをサポートする。この手法は、同種および異種の設定において、SOTA手法を上回る優れた性能を達成する。

ABSTRACT

The rapid development of Large Language Models (LLMs) has been pivotal in advancing AI, with pre-trained LLMs being adaptable to diverse downstream tasks through fine-tuning. Federated learning (FL) further enhances fine-tuning in a privacy-aware manner by utilizing clients' local data through in-situ computation, eliminating the need for data movement. However, fine-tuning LLMs, given their massive scale of parameters, poses challenges for clients with constrained and heterogeneous resources in FL. Previous methods employed low-rank adaptation (LoRA) for efficient federated fine-tuning but utilized traditional FL aggregation strategies on LoRA adapters. These approaches led to mathematically inaccurate aggregation noise, reducing fine-tuning effectiveness and failing to address heterogeneous LoRAs. In this work, we first highlight the mathematical incorrectness of LoRA aggregation in existing federated fine-tuning methods. We introduce a new approach called FLORA that enables federated fine-tuning on heterogeneous LoRA adapters across clients through a novel stacking-based aggregation method. Our approach is noise-free and seamlessly supports heterogeneous LoRA adapters. Extensive experiments demonstrate FLORA' s superior performance in both homogeneous and heterogeneous settings, surpassing state-of-the-art methods. We envision this work as a milestone for efficient, privacy-preserving, and accurate federated fine-tuning of LLMs. Our code is available at https://github.com/ATP-1010/FederatedLLM.

研究の動機と目的

  • 既存のフェデレーテッドLoRA集約手法における数学的不正確さ、特にLoRA行列AとBの独立的平均化によって生じるノイズの原因を解消すること。
  • クライアント間でデータ分布や計算リソースにばらつきがある現実的で異種の環境において、効果的なフェデレーテッドファインチューニングを可能にすること。
  • クライアント間で異なるLoRAランクをサポートし、ローカルデータやハードウェア制約に応じてクライアントが異なるアダプタランクを使用できるようにすること。
  • モデル更新の整合性を保ち、フェデレーテッドラーニングにおける収束を加速する理論的に整合性のある集約メカニズムを開発すること。
  • プライバシーと効率性を維持したまま、LLMファインチューニングにおける同種および異種のLoRA設定でSOTAの性能を達成すること。

提案手法

  • すべてのクライアントのローカルなLoRA行列AとBをランク次元に沿って連結することで、平均化を行わないグローバルなLoRA行列を形成するスタッキングベースの集約メカニズムを提案する。
  • 理論的分析により、スタッキングがグローバルモデル更新の数学的正確性を保つことを証明し、FedITの平均化手法に存在する中間ノイズ項を排除することが可能であることを示す。
  • クライアントが異なるランクを用いることを許容するため、スタッキングがこれらの差異を自然に処理できることを実現する。
  • LoRA行列をランク1のサブモジュールに分割し、スタッキングの前に順序をシャッフルすることで、悪意あるクライアントによる再構築を防止するプライバシー保護メカニズムを導入する。
  • 暗号化や微分プライバシーといった標準的なプライバシー保護メカニズムと統合し、フェデレーテッドラーニングのプライバシー保証と互換性を持つことを保証する。
  • 標準的なFedAvgに類似したFLトレーニングループを採用し、クライアントがデバイス上でローカルなLoRAモジュールをファインチューニングし、その結果をサーバーにアップロード。その後、サーバーはスタッキングを適用してグローバルモデルを形成する。

実験結果

リサーチクエスチョン

  • RQ1既存のフェデレーテッドLoRA手法(例:FedIT)における集約ノイズの数学的発生源は何か? そして、どのようにしてこれを排除できるか?
  • RQ2異なるLoRAランクをクライアント間でサポートしつつ、モデルの正確性と収束性を維持できるフェデレーテッドファインチューニング手法は可能か?
  • RQ3LoRA行列に対するスタッキングベースの集約メカニズムは、平均化ベースの手法と比較して、より速い収束と向上した性能をもたらすか?
  • RQ4データやハードウェアリソースにばらつきがある現実的で異種のクライアント環境において、FLoRAはどのように性能を発揮するか?
  • RQ5通信効率を損なわずに、グローバルモデル更新からのプライバシー漏洩を防止するための提案されたスタッキング手法は、どのようにしてセキュアに保証できるか?

主な発見

  • FLoRAは、平均化の代わりにスタッキングを採用することで、数学的に正確であり、収束が速くなるノイズフリーな集約を実現する。
  • スタッキング機構は、クライアント間での異種LoRAランクを自然にサポートし、フェデレーテッドファインチューニングにおけるクライアント参加の幅を広げる。
  • FLoRAは、LLaMA、Llama2、TinyLlamaモデルを用いたGSM8K、HumanEval、WizzARの複数のベンチマークで、SOTA手法であるFedITを上回る性能を示す。
  • LoRAランク8は、モデルやデータセットにかかわらず一貫して高い性能を発揮するが、極端なランク(例:64)はモデル依存の性能を示すため、最適ランクとモデル容量の間に相関がある可能性が示唆される。
  • FLoRAにおける通信オーバーヘッドはFedITと比べてわずかに高いが、フルファインチューニングと比較すると依然として無視できるほど小さく、大規模な展開において実用的である。
  • FLoRAのプライバシー保護設計(ランク1サブモジュールのシャッフルおよび暗号化・微分プライバシーとの互換性)により、悪意あるクライアントによるローカルLoRA行列の再構築が防止される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。