Skip to main content
QUICK REVIEW

[논문 리뷰] Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment

Tianhao Wu, Banghua Zhu|arXiv (Cornell University)|2023. 09. 30.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 인간 선호 레이블에서 유도된 비교 보상에 직접 최적화하는 궤적 기반 강화학습 알고리즘인 Pairwise Proximal Policy Optimization (P3O)를 제안한다. 이는 가치 함수 근사 및 보상 스케일링이 필요 없도록 하여, PPO 및 DPO에 비해 더 나은 KL-보상 트레이드오프와 인간 선호도 일치를 달성한다. P3O는 프oxy 보상과 GPT-4 승률 모두에서 PPO와 DPO를 능가한다.

ABSTRACT

Large Language Models (LLMs) can acquire extensive world knowledge through pre-training on large corpora. However, due to exposure to low-quality data, LLMs may exhibit harmful behavior without aligning with human values. The dominant approach for steering LLMs towards beneficial behavior involves Reinforcement Learning with Human Feedback (RLHF), with Proximal Policy Optimization (PPO) serving as the default RL optimizer. Despite its effectiveness, PPO has limitations when optimizing rewards trained from comparison-based loss. Primarily, PPO is not invariant to equivalent reward functions containing identical preference information due to the need to calibrate the reward scale. Additionally, PPO's necessity for token-wise updates introduces complexity in both function approximation and algorithm design compared to trajectory-wise optimization. This paper proposes a new framework, reinforcement learning with relative feedback, and a novel trajectory-wise policy gradient algorithm, Pairwise Proximal Policy Optimization (P3O) that operates directly on comparative rewards. We show theoretically that P3O is invariant to equivalent rewards and avoids the complexity of PPO. Empirical evaluations demonstrate that P3O outperforms PPO in the KL-Reward trade-off and can align with human preferences as well as or better than prior methods. In summary, this work introduces a simpler yet effective approach for aligning LLMs to human preferences through relative feedback.

연구 동기 및 목표

  • Bradley-Terry 손실과 같은 비교 손실로 훈련된 보상 모델을 최적화할 때 PPO의 불안정성과 보상 스케일 민감성 문제를 해결하기 위해.
  • 인간 선호 비교에서 유도된 상대 피드백을 본질적으로 다루는 강화학습 프레임워크를 개발하여 절대 보상 스케일링이 필요 없도록 하기 위해.
  • 가치 함수 추정 및 일반화된 이점 추정(GAE)과 같은 복잡한 구성 요소를 피하는 더 단순한 궤적 기반 정책 그래เดียน트 알고리즘을 설계하기 위해.
  • LLM 정렬에서 KL-보상 트레이드오프를 향상시키면서도 인간 선호도와의 강한 일치를 유지하기 위해.
  • 선호도 유지 전환 하에 등가 보상 함수에 대해 불변성을 확립하여 일관된 최적화 결과를 보장하기 위해.

제안 방법

  • 정책이 응답 쌍 간의 비교 보상 차이만을 사용하여 업데이트되는 새로운 프레임워크인 상대 피드백를 통한 강화학습을 제안한다.
  • 가치 함수 $V$나 이점 추정이 필요 없이 비교 보상에 직접 최적화하는 궤적 기반 정책 그래디언트 알고리즘인 Pairwise Proximal Policy Optimization (P3O)를 도입한다.
  • 상대 피드백을 기반으로도 정책 안정성을 유지하면서도 보상 함수의 상수 이동에 대해 불변성을 확보하는 프록시 정책 업데이트 메커니즘을 구현한다.
  • 정책 업데이트 크기와 KL 제어를 균형 잡기 위해 공동 클리핑 전략(P3O-V2)을 사용하며, 이는 개별 클리핑(P3O-V1)보다 성능이 뛰어나다.
  • Bradley-Terry 손실로 훈련된 프록시 보상 모델과 직접 작동하도록 정책 그래디언트 업데이트를 적응시켰으며, 이는 상수 보상 이동에 대해 불변성을 가진다.
  • 비교를 위한 기준으로 온라인-DPO를 도입하였으며, 이는 P3O와 달리 등가 보상에 대해 완전히 불변성이 아니라는 점을 보여준다.

실험 결과

연구 질문

  • RQ1동일한 선호도 데이터에서 유도된 등가 보상 함수에 대해 불변성을 가지는 궤적 기반 정책 그래디언트 알고리즘을 설계할 수 있는가?
  • RQ2가치 함수 근사 및 보상 스케일링을 제거함으로써 LLM 정렬에서 학습 안정성과 정렬 성능이 향상되는가?
  • RQ3P3O는 KL-보상 트레이드오프와 인간 선호도 일치 측면에서 PPO 및 DPO와 비교해 어떻게 성능을 냈는가?
  • RQ4쌍별 상대 피드백 기반 RL 알고리즘은 PPO와 같은 토큰 기반 절대 피드백 기반 방법보다 더 나은 정렬 성능을 낼 수 있는가?
  • RQ5프록시 보상 승률과 인간 선호 평가(GPT-4 기준) 사이에 뚜렷한 성능 격차가 존재하는가, 그리고 P3O는 이 격차를 메울 수 있는가?

주요 결과

  • P3O-V2는 TL;DR 및 HH 데이터셋에서 PPO 및 DPO보다 더 높은 보상을 기록하면서도 훨씬 낮은 KL-발산을 유지하여 뛰어난 KL-보상 트레이드오프를 입증한다.
  • P3O는 PPO에 대해 57.0%의 GPT-4 승률, SFT에 대해선 69.3%의 승률을 기록하며 DPO(45.4% 승률)를 능가한다. 이는 DPO가 더 높은 보상을 기록했음에도 불구하고 성능이 열 劣하다는 것을 의미한다.
  • DPO는 P3O보다 더 높은 프록시 보상을 기록하지만, KL-발산이 25% 높아, 보상과 정책 일관성 사이의 트레이드오프를 보여준다.
  • P3O-V1는 P3O-V2보다 略로 높은 보상을 기록하지만, KL 효율성이 열 劣하여 최종적으로 비교를 위한 주요 기준으로 P3O-V2를 선택하였다.
  • KL-보상 프론티어 분석 결과, P3O-V2는 HH 데이터셋에서 두 모델 크기 모두에서 PPO 및 DPO를 압도하며, 최적 범위에서 일관되게 0.1–0.3 높은 보상을 기록한다.
  • 실험 결과는 P3O가 등가 보상 함수에 대해 불변성을 가지며, PPO는 그렇지 않음을 확인하여 보상 함수 불변성에 대한 이론적 주장이 검증됨을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.