Skip to main content
QUICK REVIEW

[논문 리뷰] On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization

Jiancong Xiao, Ziniu Li|arXiv (Cornell University)|2024. 05. 26.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 강화학습에서 인간 피드백(RLHF)에 내재된 알고리즘적 편향—특히 KL 기반 정규화로 인한 선호도 붕괴—를 규명한다. 이는 소수 선호도가 무시되는 경향을 유발한다. 이를 해결하기 위해 저자는 선호도 매칭(Preference Matching, PM) RLHF를 제안하며, 보통 미분방정식에서 유도된 음의 로그확률 정규화를 사용하여 보상 최적화와 응답 다양성의 균형을 이루며, 표준 RLHF 대비 인간 선호도 일치도에서 29–41% 향상된 성과를 달성한다.

ABSTRACT

Accurately aligning large language models (LLMs) with human preferences is crucial for informing fair, economically sound, and statistically efficient decision-making processes. However, we argue that the predominant approach for aligning LLMs with human preferences through a reward model -- reinforcement learning from human feedback (RLHF) -- suffers from an inherent algorithmic bias due to its Kullback--Leibler-based regularization in optimization. In extreme cases, this bias could lead to a phenomenon we term preference collapse, where minority preferences are virtually disregarded. To mitigate this algorithmic bias, we introduce preference matching (PM) RLHF, a novel approach that provably aligns LLMs with the preference distribution of the reward model under the Bradley--Terry--Luce/Plackett--Luce model. Central to our approach is a PM regularizer that takes the form of the negative logarithm of the LLM's policy probability distribution over responses, which helps the LLM balance response diversification and reward maximization. Notably, we obtain this regularizer by solving an ordinary differential equation that is necessary for the PM property. For practical implementation, we introduce a conditional variant of PM RLHF that is tailored to natural language generation. Finally, we empirically validate the effectiveness of conditional PM RLHF through experiments on the OPT and Llama-family models, demonstrating a 29% to 41% improvement in alignment with human preferences, as measured by a certain metric, compared to standard RLHF.

연구 동기 및 목표

  • 표준 RLHF에서 KL 발산 정규화로 인해 발생하는 내재된 알고리즘적 편향을 규명하고 이를 해결하는 것.
  • 기준 모델 편향으로 인해 소수의 인간 선호도가 비례적으로 무시되는 선호도 붕괴를 완화하는 것.
  • 보상 모델의 선호도 분포를 브래드리-털리-루크/플래켓-플루스 모델 하에서 정확히 일치시키는 이론적으로 보장된 정렬 방법을 개발하는 것.
  • 텍스트 생성 중 자연어 유창성을 유지하는 조건부 PM RLHF 버전을 설계하는 것.
  • 여러 모델과 설정에서 LLM을 인간 선호도에 정렬하는 데 있어 이론적·실험적 성능을 검증하는 것.

제안 방법

  • PL 모델 하에서 정확한 선호도 일치를 위해 필요로 하는 보통 미분방정식을 풀어 유도된 선호도 매칭(PM) 정규화를 제안한다.
  • LLM의 응답에 대한 정책 확률 분포의 음의 로그를 정규화 항으로 사용하여 다양성 증진 효과를 갖는다.
  • 기준 모델에서 낮은 확률의 응답을 걸러내어 생성된 텍스트의 자연스러움을 유지하는 조건부 PM RLHF 버전을 도입한다.
  • PM 정규화를 RLHF 목표에 통합하여 보상 최적화와 보상 모델의 선호도 분포에 대한 충실한 표현 간 균형을 이룬다.
  • 일반화된 플래켓-루크 모델을 사용하여 선호도 분포를 수식화하고 정렬의 이론적 보장을 확보한다.
  • OPT-1.3B 및 Llama-2-7B 모델에 이 방법을 구현하여 표준 KL 기반 RLHF와 성능을 비교한다.

실험 결과

연구 질문

  • RQ1표준 RLHF에서 KL 기반 정규화가 알고리즘적 편향을 유도하여 소수 선호도에 대해 선호도 붕괴를 초래하는가?
  • RQ2보상 모델의 선호도 분포의 모드뿐 아니라 전체 분포와 정확히 일치시키는 정규화 방법을 설계할 수 있는가?
  • RQ3RLHF 기반 정렬에서 보상 최적화를 희생시키지 않고 응답 다양성을 어떻게 유지할 수 있는가?
  • RQ4조건부 PM RLHF 버전은 자연어 유창성을 유지하면서 선호도 일치도를 향상시킬 수 있는가?
  • RQ5다양한 선호도 분포에서 PM RLHF는 표준 RLHF에 비해 LLM의 인간 선호도 정렬 능력에서 얼마나 뛰어난가?

주요 결과

  • 조건부 PM RLHF는 OPT-1.3B 모델에서 인간 선호도 일치도에서 표준 RLHF 대비 29–41% 향상되었으며, 선호도 분산 측정 기준으로 확인되었다.
  • PM 정규화는 선호도 붕괴를 효과적으로 줄였으며, β=0.1일 때 PM 분산은 KL RLHF의 1.1555에서 α=0.5일 때 0.6839로 감소했다.
  • 높은 선호도 다양성 조건(β=1.0)에서도 PM RLHF는 KL RLHF(1.1737)에 비해 낮은 PM 분산(α=0.5일 때 0.8865)을 유지했다.
  • 응답 다양성이 향상되었으며, PM RLHF 설정에서 엔트로피가 높고 평균 응답 길이가 길어짐으로써 확인되었다.
  • 조건부 PM RLHF 버전은 자연스러움과 정렬도를 성공적으로 균형 잡아, 표준 PM RLHF에서 흔히 발생하는 부자연스러운 출력을 방지했다.
  • 이론적 분석을 통해 PM 정규화가 PL 모델 하에서 LLM 정책이 보상 모델의 선호도 분포를 정확히 일치시킴을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.