[論文レビュー] PAFT: A Parallel Training Paradigm for Effective LLM Fine-Tuning
PAFTは、同じ事前学習済み大規模言語モデルに対して、独立して教師あり微調整(SFT)と好みの整合性(例:DPO)を並列に実行し、その後パラメータ統合によってモデルを統合する並列訓練パラダイムを導入する。SFTにL1正則化を適用することでスパarsityを誘発し、統合時の干渉を低減することで、最先端性能を達成。7BモデルカテゴリでHuggingFace Open LLM Leaderboardで平均スコア0.6524を記録し、1位を獲得した。
Large language models (LLMs) have shown remarkable abilities in diverse natural language processing (NLP) tasks. The LLMs generally undergo supervised fine-tuning (SFT) followed by preference alignment to be usable in downstream applications. However, this sequential training pipeline leads to alignment tax that degrades the LLM performance. This paper introduces PAFT, a new PArallel training paradigm for effective LLM Fine-Tuning, which independently performs SFT and preference alignment (e.g., DPO and ORPO, etc.) with the same pre-trained model on respective datasets. The model produced by SFT and the model from preference alignment are then merged into a final model by parameter fusing for use in downstream applications. This work reveals important findings that preference alignment like DPO naturally results in a sparse model while SFT leads to a natural dense model which needs to be sparsified for effective model merging. This paper introduces an effective interference resolution which reduces the redundancy by sparsifying the delta parameters. The LLM resulted from the new training paradigm achieved Rank #1 on the HuggingFace Open LLM Leaderboard. Comprehensive evaluation shows the effectiveness of the parallel training paradigm.
研究の動機と目的
- 大規模言語モデルの微調整において、逐次的SFTの後に好みの整合性をとる際の整合性の負担(alignment tax)を軽減すること。
- 不要なデルタパラメータによるパラメータ干渉がもたらすモデル統合時の性能低下を低減すること。
- SFTデルタパラメータにL1正則化を適用することでスパarsityを誘発し、モデル統合の効果を高めること。
- スパースなモデル統合を用いた並列学習が、逐次学習および既存の統合手法を上回ることを実証すること。
- SFTと好みの整合性を統合する強力で一般化可能なフレームワークを構築し、公開ベンチマークで最先端の結果を達成すること。
提案手法
- SFT用と好みの整合性(例:DPO)用の別々のデータセットを用いて、SFTと好みの整合性の両方を別々に学習する並列学習パラダイム(PAFT)を提案する。
- SFT損失関数にL1ノルムペナルティを適用することで、微調整済み重みと事前学習済み重みの差(デルタパラメータ)に暗黙的にスパarsityを誘発する。
- SFTと好みの整合性から得られたスパースデルタパラメータを用いて、パラメータ統合によりモデルを統合し、モデルの能力を保持する。
- TIESとTask Arithmeticを代表的な統合手法として採用し、Mistral-7BではTIESが優れた性能を示した。
- HuggingFace Open LLM LeaderboardおよびAlpacaEvalベンチマークを用いて、包括的な評価を実施する。
- L1ベースのスパarsity手法をDAREなどの明示的スパarsity手法と比較し、L1が性能と品質の両面で優れていることを示した。

実験結果
リサーチクエスチョン
- RQ1SFTと好みの整合性の並列学習は、逐次学習と比較して整合性の負担を軽減するか?
- RQ2SFTデルタパラメータにスパarsityを誘発することで、モデル統合時の干渉を軽減できるか?
- RQ3L1正則化は、DAREのような明示的スパarsity手法よりも、統合モデルの性能向上に有効か?
- RQ4TIES や Task Arithmetic などのモデル統合手法の中で、PAFTと組み合わせた場合に最も優れた結果をもたらすのはどれか?
- RQ5PAFTは、DPOにとどまらず、ORPOのような他の好みの整合性手法に対しても一般化可能か?
主な発見
- PAFTパラダイムは、7BモデルカテゴリのHuggingFace Open LLM Leaderboardにおいて6つのタスクの平均で0.6524という新しいSOTAスコアを達成し、7B/8Bカテゴリで1位を獲得した。
- PAFTを適用した70Bモデルは、HuggingFace Open LLM Leaderboardでグローバル1位を獲得し、スケーラビリティと一般化能力を実証した。
- L1正則化を施したスパースSFT(Parallel SFT_spar se)は、すべての統合手法およびベンチマークで非スパースSFTを上回る一貫した性能を示した。
- SFTデルタパラメータにスパarsityを誘発するためのL1ノルム法は、明示的DARE法よりも効果的かつ高品質な結果をもたらした。
- TIESとTask Arithmeticは最も効果的な統合戦略と特定され、Mistral-7BではTIESが最良の結果を出した。
- DPOやORPOのような好みの整合性手法はいずれもPAFTの恩恵を受け、本フレームワークの整合性手法への一般化可能性を確認した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。