Skip to main content
QUICK REVIEW

[논문 리뷰] RLHF Workflow: From Reward Modeling to Online RLHF

Hanze Dong, Wei Xiong|arXiv (Cornell University)|2024. 05. 13.
Simulation Techniques and ApplicationsDecision Sciences인용 수 3
한 줄 요약

이 논문은 다양한 오픈소스 데이터셋을 기반으로 훈련된 프록시 선호 모델을 사용하여 인간 피드백에서 온라인 반복 강화학습(RLHF)을 복제 가능하고 완전히 오픈소스 워크플로우로 제안한다. 이 방법은 AlpacaEval-2, Arena-Hard, MT-Bench 등의 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, SFR-Iterative-DPO-LLaMA-3-8B-R 모델은 반복적인 온정책 최적화와 길이 페널티 완화를 통해 오프라인 기준선을 초월한다.

ABSTRACT

We present the workflow of Online Iterative Reinforcement Learning from Human Feedback (RLHF) in this technical report, which is widely reported to outperform its offline counterpart by a large margin in the recent large language model (LLM) literature. However, existing open-source RLHF projects are still largely confined to the offline learning setting. In this technical report, we aim to fill in this gap and provide a detailed recipe that is easy to reproduce for online iterative RLHF. In particular, since online human feedback is usually infeasible for open-source communities with limited resources, we start by constructing preference models using a diverse set of open-source datasets and use the constructed proxy preference model to approximate human feedback. Then, we discuss the theoretical insights and algorithmic principles behind online iterative RLHF, followed by a detailed practical implementation. Our trained LLM achieves impressive performance on LLM chatbot benchmarks, including AlpacaEval-2, Arena-Hard, and MT-Bench, as well as other academic benchmarks such as HumanEval and TruthfulQA. We have shown that supervised fine-tuning (SFT) and iterative RLHF can obtain state-of-the-art performance with fully open-source datasets. Further, we have made our models, curated datasets, and comprehensive step-by-step code guidebooks publicly available. Please refer to https://github.com/RLHFlow/RLHF-Reward-Modeling and https://github.com/RLHFlow/Online-RLHF for more detailed information.

연구 동기 및 목표

  • 자신감 있는 오픈소스 RLHF와 폐쇄소스 RLHF 간 격차를 좁히기 위해 자원 제약 조건에서도 온라인 반복 RLHF를 가능하게 하기 위해.
  • 오픈소스 데이터셋을 인간 피드백의 프록시로 사용하여 온라인 반복 RLHF를 위한 실용적이고 복제 가능한 파ip라인을 개발하기 위해.
  • 보상 모델링 중에 학습된 길이 페널티를 통해 대규모 언어 모델의 응답 길이 편향을 완화하기 위해.
  • 완전히 오픈소스 데이터 및 모델을 사용하여 표준 대규모 언어 모델 벤치마크에서 최신 기술 수준 성능을 입증하기 위해.
  • 오픈소스 RLHF의 접근 장벽을 낮추기 위해 종합적인 코드, 데이터셋, 하이퍼파라미터 가이드를 제공하기 위해.

제안 방법

  • 다양한 오픈소스 선호 데이터셋을 사용하여 인간 피드백을 시뮬레이션하는 프록시 선호 모델을 구축한다.
  • 온정책 샘플링을 사용한 반복적 직접 선호 최적화(DPO)를 적용하여 폐쇄형 루프 방식으로 정책을 개선한다.
  • 보상 최적화와 초기 정책에서의 산발성 간 균형을 유지하기 위해 KL 정규화된 목표 함수를 최적화한다.
  • 과도한 어휘의 사용을 줄이고 응답 품질을 향상시키기 위해 보상 함수에 길이 페널티를 통합한다.
  • 브래들리-테리 모델을 활용하여 선호 신호를 확률적 보상으로 수식화한다: $\mathbb{P}(a^1 \succ a^2) = \sigma(r^*(x,a^1) - r^*(x,a^2))$.
  • 인간 피드백 프록시와 보상 품질 및 길이 제어에 대한 아블레이션 연구를 통해 반복적인 피팅을 통해 최종 모델인 SFR-Iterative-DPO-LLaMA-3-8B-R을 훈련한다.

실험 결과

연구 질문

  • RQ1직접적인 인간 피드백 없이 자원 제약 조건에서 오픈소스 환경에서 온라인 반복 RLHF를 효과적으로 구현할 수 있는가?
  • RQ2오픈소스 데이터셋에서 훈련된 프록시 선호 모델이 인간 피드백과 비교해 정렬 품질과 모델 성능 측면에서 어떻게 성능을 내는가?
  • RQ3반복 RLHF에서 학습된 길이 페널티가 응답 품질과 벤치마크 성능에 어떤 영향을 미치는가?
  • RQ4보상 모델의 선택이 수렴 속도, 응답 길이, 학술 기반 벤치마크와 채팅 기반 벤치마크에서의 성능에 어떤 영향을 미치는가?
  • RQ5프록시 피드백를 사용한 반복적 온정책 RLHF가 폐쇄소스 모델과 비교해 최신 기술 수준 성능을 달성할 수 있는가?

주요 결과

  • SFR-Iterative-DPO-LLaMA-3-8B-R 모델은 AlpacaEval-2에서 41.9%의 승리 비율을 기록하며, 길이 페널티가 없는 기준선을 크게 앞서나간다.
  • 길이 페널티가 적용된 모델은 Arena-Hard 벤치마크에서 평균 응답 길이를 656 토큰에서 382 토큰으로 줄여 길이 제어 성능이 향상됨을 확인했다.
  • UltraRM-13B로 훈련된 모델는 더 높은 훈련 손실과 느린 수렴 속도를 보이며, 제안된 프록시 모델이 더 복잡한 선호 신호를 제공함을 시사한다.
  • 더 긴 응답을 내는 데에도 불구하고, UltraRM-13B 모델은 Arena-Hard에서 더 높은 승리 비율(29.1 vs. 22.1)을 기록하여 이 벤치마크에서 어휘의 과도한 사용 편향이 존재함을 시사한다.
  • 길이 페널티가 적용된 모델은 HumanEval(+66.5)과 TruthfulQA(+65.1)에서 더 우수한 성능을 기록하여 추론 능력과 사실 일관성 향상이 확인되었다.
  • 아블레이션 연구는 보상 모델 품질과 길이 페널티가 특히 추론 및 정렬 벤치마크에서 성능에 결정적인 요소임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.