Skip to main content
QUICK REVIEW

[論文レビュー] On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization

Jiancong Xiao, Ziniu Li|arXiv (Cornell University)|May 26, 2024
Natural Language Processing Techniques被引用数 4
ひとこと要約

この論文は、強化学習による人間フィードバック(RLHF)に内在するアルゴリズム的バイアス——特にKL正則化に起因する少数派の好みを無視するPreference collapse——を特定する。これを解決するために、通常微分方程式から導かれる負の対数尤度正則化子を用いた、新しいPreference Matching(PM)RLHFを提案する。この方法は報酬最大化と応答多様性のバランスを図り、標準的なRLHFに比べて人間の好みとの整合性で29–41%の向上を達成する。

ABSTRACT

Accurately aligning large language models (LLMs) with human preferences is crucial for informing fair, economically sound, and statistically efficient decision-making processes. However, we argue that the predominant approach for aligning LLMs with human preferences through a reward model -- reinforcement learning from human feedback (RLHF) -- suffers from an inherent algorithmic bias due to its Kullback--Leibler-based regularization in optimization. In extreme cases, this bias could lead to a phenomenon we term preference collapse, where minority preferences are virtually disregarded. To mitigate this algorithmic bias, we introduce preference matching (PM) RLHF, a novel approach that provably aligns LLMs with the preference distribution of the reward model under the Bradley--Terry--Luce/Plackett--Luce model. Central to our approach is a PM regularizer that takes the form of the negative logarithm of the LLM's policy probability distribution over responses, which helps the LLM balance response diversification and reward maximization. Notably, we obtain this regularizer by solving an ordinary differential equation that is necessary for the PM property. For practical implementation, we introduce a conditional variant of PM RLHF that is tailored to natural language generation. Finally, we empirically validate the effectiveness of conditional PM RLHF through experiments on the OPT and Llama-family models, demonstrating a 29% to 41% improvement in alignment with human preferences, as measured by a certain metric, compared to standard RLHF.

研究の動機と目的

  • 標準RLHFにおけるKLダイバージェンス正則化に起因する、内在的なアルゴリズム的バイアスを特定・解消すること。
  • 参照モデルのバイアスに起因して、少数派の人間の好みが不均衡に無視されるPreference collapseを緩和すること。
  • Bradley–Terry–Luce/Plackett–Luceモデル下で、報酬モデルの好み分布を正確に再現する、証明可能に整合性のある手法を開発すること。
  • 自然言語の流暢さを保ちながら、テキスト生成中に維持できるPM RLHFの条件付きバージョンを設計すること。
  • 複数のモデルと設定において、LLMの人の好みとの整合性を向上させるという点で、本手法の優位性を実証的に検証すること。

提案手法

  • PLモデル下で正確な好みの一致を実現するために必要な通常微分方程式を解くことにより導かれる、Preference Matching(PM)正則化子を提案する。
  • LLMのポリシー確率分布の負の対数をPM正則化子として定式化し、多様性を促進する正則化項として機能させる。
  • 参照モデルが低い確率で出力する応答をフィルタリングすることで、自然なテキスト生成を維持するPM RLHFの条件付きバージョンを導入する。
  • PM正則化子をRLHFの目的関数に統合し、報酬最大化と報酬モデルの好み分布の忠実な再現の両立を図る。
  • 一般化されたPlackett-Luceモデルを用いて好みの分布を形式化し、整合性の理論的保証を確保する。
  • OPT-1.3BおよびLlama-2-7Bモデルに本手法を実装し、標準的なKLベースのRLHFと性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1標準RLHFにおけるKLベースの正則化は、特に少数派の好みに対して、アルゴリズム的バイアスを引き起こし、Preference collapseを引き起こすか?
  • RQ2報酬モデルの好み分布のモードだけでなく、全体の分布に正確に一致させるような正則化法を設計できるか?
  • RQ3報酬最大化を犠牲にせずに、RLHFベースの整合性のプロセスで応答の多様性をどのように維持できるか?
  • RQ4PM RLHFの条件付きバージョンは、自然な言語の流暢さを保ちながら、好みの整合性を向上させられるか?
  • RQ5異なる好みの分布に対して、PM RLHFは標準RLHFに比べて、LLMの人間の好みとの整合性をどの程度向上させられるか?

主な発見

  • 条件付きPM RLHFは、OPT-1.3Bモデルにおいて、好みの乖離指標で測定したところ、標準RLHFに比べて人間の好みとの整合性で29–41%の向上を達成した。
  • PM正則化子はPreference collapseを効果的に低減し、β=0.1の下でPM乖離がKL RLHFの1.1555からα=0.5の0.6839に低下した。
  • 高い好みの多様性(β=1.0)の下でも、PM RLHFはKL RLHF(1.1737)に比べて低いPM乖離(α=0.5で0.8865)を維持した。
  • 本手法は応答の多様性を向上させたことが、PM RLHF設定におけるエントロピーの上昇と平均応答長の延長から裏付けられた。
  • 条件付きPM RLHFのバージョンは、自然さと整合性の両立に成功し、標準PM RLHFで見られる不自然な出力を回避した。
  • 理論的分析により、PM正則化子がPLモデル下でLLMポリシーが報酬モデルの好み分布と一致することを保証することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。