Skip to main content
QUICK REVIEW

[論文レビュー] Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data

Fahim Tajwar, Anikait Singh|arXiv (Cornell University)|Apr 22, 2024
Efficiency Analysis Using DEADecision Sciences被引用数 3
ひとこと要約

本稿は、大規模言語モデル(LLMs)の好みの微調整において、部分的に最適でない、ポリシーに従う応答と負の勾配目的関数が、高い報酬を持つ応答への確率質量の再配分をより速く効果的に可能にすることを示している。著者らは『モード探索型』目的関数——逆KLダイバージェンスの枠組みに統合された——を導入し、特に高い報酬を持つ応答が参照ポリシーの低確率領域に位置する場合に、標準的な最大尤度法やオフライン教師あり手法を上回る性能を発揮することを示している。

ABSTRACT

Learning from preference labels plays a crucial role in fine-tuning large language models. There are several distinct approaches for preference fine-tuning, including supervised learning, on-policy reinforcement learning (RL), and contrastive learning. Different methods come with different implementation tradeoffs and performance differences, and existing empirical findings present different conclusions, for instance, some results show that online RL is quite important to attain good fine-tuning results, while others find (offline) contrastive or even purely supervised methods sufficient. This raises a natural question: what kind of approaches are important for fine-tuning with preference data and why? In this paper, we answer this question by performing a rigorous analysis of a number of fine-tuning techniques on didactic and full-scale LLM problems. Our main finding is that, in general, approaches that use on-policy sampling or attempt to push down the likelihood on certain responses (i.e., employ a "negative gradient") outperform offline and maximum likelihood objectives. We conceptualize our insights and unify methods that use on-policy sampling or negative gradient under a notion of mode-seeking objectives for categorical distributions. Mode-seeking objectives are able to alter probability mass on specific bins of a categorical distribution at a fast rate compared to maximum likelihood, allowing them to relocate masses across bins more effectively. Our analysis prescribes actionable insights for preference fine-tuning of LLMs and informs how data should be collected for maximal improvement.

研究の動機と目的

  • 好みの微調整にあたって、ポリシーに従う強化学習(RL)とオフライン手法のどちらが必須であるかについて、LLMコミュニティ内で生じる混乱を解消すること。
  • ポリシーに従うデータ収集と負の勾配目的関数が、微調整性能向上に果たす役割を調査すること。
  • ポリシーに従うRLや対照学習といった多様な手法を、共通の理論的枠組みに統一すること。
  • ポリシーに従うサンプリングと負の勾配が、好みの整合性に特に効果的である状況とその理由を特定すること。
  • LLM好みの微調整におけるデータ収集と最適化に役立つ実用的知見を提供すること。

提案手法

  • 著者らは、ディクティック・バンディット問題、合成LLM問題、およびAlpacaFarmとUltraFeedbackデータセットを用いた大規模なLLM実験を設計した。
  • 被覆性と幾何的条件を制御した状況下で、教師あり学習、対照学習、ポリシーに従う強化学習を比較した。
  • 負の勾配目的関数が確率質量を再配分する際に優れている理由を説明する理論的枠組みを、逆KLダイバージェンスに基づいて構築した。
  • 『モード探索』行動を、高報酬応答のビンに確率質量を素早く集中させることとして形式化し、これに対して『モードカバレッジ』型の最大尤度目的関数と対比した。
  • 前向きKLと逆KLダイバージェンスの挙動を分析し、逆KLが現在の高い尤度領域を優先することで、一度のステップでより速やかに確率質量を再重み付けできることを示した。
  • 実験的に、ポリシーに従うサンプリングと負の勾配が相補的であり、とくに高い報酬応答が参照ポリシー下でまれな場合に極めて重要であることを検証した。

実験結果

リサーチクエスチョン

  • RQ1高報酬応答が参照ポリシーの低尤度領域に位置する場合、効果的な好みの微調整にはいつポリシーに従うサンプリングが必要となり、いつオフライン手法で十分なのか?
  • RQ2対照的学習や強化学習の目的関数といった負の勾配を持つ手法が、標準的な最大尤度による教師あり微調整をなぜ上回るのか?
  • RQ3参照ポリシーと真の報酬ピークとの間の幾何的関係が、手法の性能にどのように影響するか?
  • RQ4ポリシーに従う強化学習と対照学習の成功を説明する統一的原則は存在するか?
  • RQ5参照ポリシー下での高報酬応答の初期尤度が、さまざまな微調整戦略の有効性を決定づける役割を果たすか?

主な発見

  • 高報酬応答が参照ポリシーの低尤度領域に位置する場合、ポリシーに従うサンプリングは、これらの領域への直接的探索を可能にすることで、性能を顕著に向上させる。
  • 対照学習やポリシーに従う強化学習に用いられる負の勾配目的関数は、高報酬応答への確率質量の再配分をより速く行えるため、最大尤度法やオフライン教師あり手法を上回る。
  • ポリシーに従うサンプリングと負の勾配の組み合わせは、好みのデータが参照ポリシーからずれている場合に特に相乗効果を発揮する。
  • 逆KLダイバージェンスを用いてモード探索行動を誘発する手法は、『モードカバレッジ』型の目的関数よりも、高報酬応答のサブセットに確率質量を集約する速度がはるかに速い。
  • 教師あり微調整手法(例:Pref-FT や Binary Feed-ME)は、完全なデータ被覆性があるにもかかわらず、低報酬から高報酬への質量のシフトを効果的に実現できない。
  • 理論的分析により、逆KLが現在の高い尤度領域を優先することで、一度のステップで確率質量の再重み付けをより効率的に行えることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。