[논문 리뷰] HelpSteer2-Preference: Complementing Ratings with Preferences
이 논문은 브래드리-터니 모델링과 회귀 스타일 보상 모델링 간의 직접 비교를 가능하게 하기 위해 인간이 작성한 정당화 내용을 포함한 새로운 고품질 선호도 데이터셋을 소개한다. 일치하는 데이터로 모델을 훈련하고 평가함으로써, 두 방법을 결합한 하이브리드 접근법을 제안하며, 이는 Llama-3.1-70B-Instruct 기반의 보상 모델이 2024년 10월 기준으로 140개 이상의 모델 중에서 RewardBench에서 94.1점을 기록함으로써 뛰어난 정렬 성능을 입증한다.
Reward models are critical for aligning models to follow instructions, and are typically trained following one of two popular paradigms: Bradley-Terry style or Regression style. However, there is a lack of evidence that either approach is better than the other, when adequately matched for data. This is primarily because these approaches require data collected in different (but incompatible) formats, meaning that adequately matched data is not available in existing public datasets. To tackle this problem, we release preference annotations (designed for Bradley-Terry training) to complement existing ratings (designed for Regression style training) in the HelpSteer2 dataset. To improve data interpretability, preference annotations are accompanied with human-written justifications. Using this data, we conduct the first head-to-head comparison of Bradley-Terry and Regression models when adequately matched for data. Based on insights derived from such a comparison, we propose a novel approach to combine Bradley-Terry and Regression reward modeling. A Llama-3.1-70B-Instruct model tuned with this approach scores 94.1 on RewardBench, emerging top of more than 140 reward models as of 1 Oct 2024. This reward model can then be used with REINFORCE algorithm (RLHF) to align an Instruct model to reach 85.0 on Arena Hard, which is No. 1 as of 1 Oct 2024. We open-source this dataset (CC-BY-4.0 license) at https://huggingface.co/datasets/nvidia/HelpSteer2#preferences-new -- 1-oct-2024 and openly release the trained Reward and Instruct models at https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward and https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Instruct
연구 동기 및 목표
- 브래드리-터니 모델링과 회귀 스타일 보상 모델링 간의 직접적인 경험적 비교가 불가능한 이유는 데이터 포맷이 상호 호환되지 않기 때문이다.
- 두 보상 모델링 철학을 공정하게 평가할 수 있도록 인간이 작성한 정당화 내용이 포함된 고품질의 일치하는 선호도 데이터셋을 공개한다.
- 브래드리-터니 모델링과 회귀 스타일 훈련을 결합함으로써 보상 모델 성능 향상 여부를 조사한다.
- 강화학습 기반 지시 토닝(RLHF)을 통한 제안된 하이브리드 보상 모델의 효과성을 입증한다.
- 공개된 데이터셋(CC-BY-4.0)과 훈련된 보상 모델을 통해 향후 연구를 위한 기준을 마련한다.
제안 방법
- 저자들은 기존의 Likert-5 평가와 함께 HelpSteer2 데이터셋의 선호도 애너테이션을 공개하여, 브래드리-터니 및 회귀 훈련 모두에 적합한 형식으로 데이터를 수집한다.
- 선호도 애너테이션에는 한 응답이 다른 응답보다 선호되는 이유를 설명하는 인간이 작성한 정당화 내용이 포함되어 있어, 해석 가능성과 모델 일반화 능력을 향상시킨다.
- 동일한 프롬프트와 응답을 사용하여, 일치하는 데이터로 훈련된 브래드리-터니 모델과 회귀 스타일 모델 간의 헤드-투-헤드 비교를 수행한다.
- 두 모델의 예측을 융합하여 상호 보완적인 강점을 활용하는 하이브리드 보상 모델링 접근법을 제안한다.
- 최종 보상 모델은 Llama-3.1-70B-Instruct 기반 모델을 사용하여 선호도 신호와 평가 신호의 조합을 통해 피니테이닝하며, REINFORCE, PPO, DPO를 통한 최적화를 수행한다.
- 지시 수행 정렬 성능 평가를 위해 RewardBench, MT-Bench, AlpacaEval 2.0, Arena Hard 등의 표준 벤치마크에서 모델을 평가한다.

실험 결과
연구 질문
- RQ1적절히 일치된 고품질 데이터로 훈련된 경우, 브래드리-터니 스타일 보상 모델링이 회귀 스타일 모델링을 능가하는가?
- RQ2선호도 순위에 대한 인간이 작성한 정당화 내용이 보상 모델의 성능 향상에 기여하는가?
- RQ3브래드리-터니 및 회귀 스타일 보상 모델링 신호를 결합함으로써 성능 향상이 이루어지는가?
- RQ4하이브리드 보상 모델은 표준 정렬 벤치마크에서 최신 기술(SOTA) 모델과 비교해 어떻게 성능을 내는가?
- RQ5고품질의 일치 데이터는 두 주요 보상 모델링 철학 간의 공정한 경험적 비교를 가능하게 하는가?
주요 결과
- 브래드리-터니와 회귀 스타일 훈련을 융합한 하이브리드 보상 모델은 2024년 10월 1일 기준으로 RewardBench에서 94.1점을 기록하여 140개 이상의 보상 모델 중 1위를 차지했다.
- 이 연구는 새로 공개된 선호도 애너테이션을 통해 브래드리-터니 모델이 고품질 보상 모델링에 효과적으로 훈련될 수 있음을 입증하며, 그 유용성을 검증했다.
- 선호도에 대한 인간이 작성한 정당화 내용을 통합함으로써 보상 모델의 성능 향상이 측정 가능하게 되었으며, 특히 복잡하거나 미묘한 응답 순위 매기기에서 두드러진 성능 향상이 관찰되었다.
- 저품질 데이터(예: HH-RLHF)로 훈련된 모델과 고품질 데이터(예: HelpSteer2)로 훈련된 모델 간의 성능 격차는 뚜렷했으며, 후자는 RewardBench Chat-Hard 벤치마크에서 80% 이상의 정확도를 달성했다.
- 제안된 하이브리드 접근법은 독립적으로 훈련된 브래드리-터니 모델과 회귀 모델을 모두 능가했으며, 신호 학습에서 상호 보완적인 강점이 있음을 시사한다.
- 공개된 데이터셋과 보상 모델은 향후 보상 모델링 및 지시 토닝 분야의 연구를 위한 새로운 기준이 될 것으로 기대된다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.