[論文レビュー] Preserving Diversity in Supervised Fine-Tuning of Large Language Models
この論文は、交差エントロピー損失の代わりに逆Kullback-Leibler発散の最小化とエントロピー正則化を組み合わせた、大規模言語モデルのための新しい教師あり微調整手法GEM(Generative Entropy-regularized Matching)を提案する。GEMは過学習を軽減し、生成の多様性を著しく向上させ、コード生成および数学的推論ベンチマークにおいて、best-of-nサンプリングを用いた場合、Llama-3-8Bで標準の交差エントロピー損失および重み減衰ベースラインを上回る最高で10ポイントの性能向上を達成する。
Large Language Models (LLMs) typically rely on Supervised Fine-Tuning (SFT) to specialize in downstream tasks, with the Cross Entropy (CE) loss being the de facto choice. However, CE maximizes the likelihood of observed data without accounting for alternative possibilities. As such, CE usually leads to reduced diversity in the model's outputs, which hinders further development that requires sampling to explore better responses. To address this limitation, this paper introduces a new game-theoretic formulation for SFT. In this framework, an auxiliary variable is introduced to regulate the learning process. We prove that the proposed game-theoretic approach connects to the problem of reverse KL minimization with entropy regularization. This regularization prevents over-memorization of training data and promotes output diversity. To implement this framework, we develop GEM, a new training algorithm that is computationally efficient as CE by leveraging some unique properties of LLMs. Empirical studies of pre-trained models from 3B to 70B parameters show that GEM achieves comparable downstream performance to CE while significantly enhancing output diversity. This increased diversity translates to performance gains in test-time compute scaling for chat and code generation tasks. Moreover, we observe that preserving output diversity has the added benefit of mitigating forgetting, as maintaining diverse outputs encourages models to retain pre-trained knowledge throughout the training process.
研究の動機と目的
- 大規模言語モデル(LLMs)の教師あり微調整(SFT)における過学習と生成多様性の制限を是正すること。これは、一般的に交差エントロピー(CE)損失の過剰な更新に起因する。
- データ忠実度を保ちながら、より平坦で多様な出力分布を促進する、原理的で代替可能なCE損失の代替策を開発すること。
- 特にbest-of-nサンプリングのような高度なデコード戦略に依存するタスクにおいて、一般化性能を向上させ、モデルの多様性を強化することで、下流タスクの性能を向上させること。
- 標準的なSFTトレーニングの代替手段として、実用的で効果的な逆KL発散のエントロピー正則化最小化の有効性を示すこと。
- 標準SFTパイプラインと互換性があり、一般およびドメイン特化型のインstructチューニングに適用可能なスケーラブルで効率的な手法を提供すること。
提案手法
- 逆Kullback-Leibler(KL)発散を、データ分布とモデルの生成分布との間で最小化する、エントロピー正則化を組み合わせた新しいトレーニング目的であるGEM(Generative Entropy-regularized Matching)を提案。
- 敵対的訓練を回避する実用的な最適化スキームを採用し、計算効率が良く、標準SFTフレームワークと互換性がある。
- データ尤度と出力多様性のバランスを取るために、尤度を保ちつつエントロピーを最大化する損失関数を導入。
- 微調整中にエントロピー正則化逆KL目的を微分可能に最適化可能にするために、再パrameterizationトリックを採用。
- 一般(UltraFeedback)およびドメイン特化型(MetaMathQA, Magicoder-OSS-Instruct)のデータセットを用いて、Llama-3-8Bに適用し、一般化性能と多様性を評価。
- 多様性の向上を評価するために、best-of-nサンプリングと多数決投票を用い、コードおよび数学ベンチマークにおけるpass@100および正答率の指標を測定。

実験結果
リサーチクエスチョン
- RQ1交差エントロピー損失をエントロピー正則化逆KL発散最小化に置き換えることで、LLMの教師あり微調整における過学習を軽減できるか?
- RQ2提案されたGEM手法は、ドメイン特化型データを必要とせずに、LLMの生成多様性を向上させることができるか?
- RQ3GEMは、数学的推論やコード生成のように多様な出力に依存する下流タスクにおいて、どの程度性能を向上させるか?
- RQ4GEMは、異なるデータセットにおいて、標準的なCE損失および重み減衰正則化と比較して、一般化性能およびロバストネスに優れているか?
- RQ5エントロピー正則化は、mode collapseを緩和し、best-of-nサンプリングのような高度なデコード戦略下でも性能を向上させることができるか?
主な発見
- インstructチューニング用のUltraFeedbackデータセットにおいて、GEMはパープレキシティを低減し、IFEvalスコアを向上させ、CE損失と比較して過学習が少ないことを示した。
- GSM8KおよびMATHの数学的推論タスクにおいて、GEM-LSはそれぞれBON@32でCEと比較して2.6ポイントおよび1.6ポイントの向上を達成し、多様性と一般化性能の向上を実証した。
- コード生成ベンチマークでは、HumanEvalでPass@100がCEと比較して9.7ポイント(相対で14.7%)向上し、MBPPでも8.0ポイント(相対で11.1%)の向上を達成した。
- より困難なMATHベンチマークでは、グリーディデコードで1.9ポイント(相対8.0%)、多数決で1.7ポイント(相対5.8%)の向上を示し、困難なタスクに対してもロバストであることを示した。
- 重み減衰正則化は一貫した向上を示さなかったが、GEMはすべてのベンチマークおよび設定でCEを一貫して上回り、過学習の軽減と多様性の向上の有効性を確認した。
- 結果から、GEMのエントロピー正則化が過学習を効果的に抑制し、best-of-nサンプリングにおけるテスト時計算および自己改善パイプラインでの有用性を裏付けている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。