Skip to main content
QUICK REVIEW

[논문 리뷰] Rewarded soups: towards Pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards

Alexandre Ramé, Guillaume Couairon|arXiv (Cornell University)|2023. 06. 07.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 다양한 프록시 보상에 대해 단일 기초 모델을 피지터링하고 결과적으로 생성된 가중치를 선형으로 보간함으로써 모델 정렬을 향상시키는 다중 정책 전략인 Rewarded Soup (RS)을 제안한다. 이 방법은 텍스트, 시각, 제어 작업 전반에서 다중 목적 강화학습(MORL)에 비해 훨씬 적은 계산 자원을 사용하면서도 다수의 목적에 대해 파레토 최적 성능을 달성한다.

ABSTRACT

Foundation models are first pre-trained on vast unsupervised datasets and then fine-tuned on labeled data. Reinforcement learning, notably from human feedback (RLHF), can further align the network with the intended usage. Yet the imperfections in the proxy reward may hinder the training and lead to suboptimal results; the diversity of objectives in real-world tasks and human opinions exacerbate the issue. This paper proposes embracing the heterogeneity of diverse rewards by following a multi-policy strategy. Rather than focusing on a single a priori reward, we aim for Pareto-optimal generalization across the entire space of preferences. To this end, we propose rewarded soup, first specializing multiple networks independently (one for each proxy reward) and then interpolating their weights linearly. This succeeds empirically because we show that the weights remain linearly connected when fine-tuned on diverse rewards from a shared pre-trained initialization. We demonstrate the effectiveness of our approach for text-to-text (summarization, Q&A, helpful assistant, review), text-image (image captioning, text-to-image generation, visual grounding, VQA), and control (locomotion) tasks. We hope to enhance the alignment of deep models, and how they interact with the world in all its diversity.

연구 동기 및 목표

  • 다양하고 상충되는 인간의 선호와 프록시 보상에 기초한 기초 모델의 정렬 문제를 해결한다.
  • 공동의견을 우선시하여 다양한 시각을 간과할 수 있는 단일 정책 정렬 전략의 한계를 극복한다.
  • 각 보상 가중치에 대해 별도의 모델을 훈련하는 것을 방지하는 다중목적 강화학습(MORL)의 확장성과 효율성에 뒤처지지 않는 스케일러블하고 효율적인 대안을 개발한다.
  • 독립적으로 미세조정된 모델의 가중치를 선형으로 보간함으로써 다양한 목적에 걸쳐 성능이 유지됨을 입증한다.
  • 보간 계수를 통해 런타임에서 모델 행동을 동적으로 선택할 수 있도록 하여 사용자 선호에 대한 적응성을 향상시킨다.

제안 방법

  • 동일한 사전 훈련된 기초 모델을 N개의 다른 프록시 보상에 대해 독립적으로 미세조정하여 N개의 서로 다른 정책 헤드를 생성한다.
  • 가중치 공간에서 최종적으로 훈련된 가중치를 선형으로 보간한다: θ_λ = λ·θ₁ + (1−λ)·θ₂, 여기서 λ ∈ [0,1]은 추론 시점에 선택된다.
  • 같은 사전 훈련 체크포인트에서 초기화된 후, 다양한 보상에 대해 미세조정된 가중치가 선형적으로 연결되어 있음을 경험적으로 관찰한다.
  • 인간의 선호 모델과 자동 메트릭(예: BLEU, METEOR)을 포함한 REINFORCE 기반 강화학습을 사용해 프록시 보상에 대해 미세조정한다.
  • 가중치 보간을 안정적으로 유지하기 위해 사전 훈련 동안 사용된 동일한 정규화 및 관측 통계를 미세조정 시에도 적용한다.
  • 상충하는 보상 간의 트레이드오프를 균형 잡기 위해 추론 시 최적의 보간 계수 λ를 선택함으로써 파레토 최적의 행동을 달성한다.

실험 결과

연구 질문

  • RQ1다양한 프록시 보상에 대해 미세조정된 모델의 가중치를 선형으로 보간하는 것이 다수의 목적에 대해 파레토 최적의 성능을 달성할 수 있는가?
  • RQ2Rewarded Soup의 성능는 정확도와 계산 비용 측면에서 다중목적 강화학습(MORL)에 비해 어떻게 비교되는가?
  • RQ3요약, VQA, 이미지 캡션 생성, 그리고 운동 제어와 같은 다양한 작업에서 미세조정된 가중치의 선형 연결성이 유지되는가?
  • RQ4Rewarded Soup는 보간을 통해 추론 시점에 모델 행동을 동적으로 적응시킬 수 있으며, 이로써 런타임에서 사용자 선호를 선택할 수 있는가?
  • RQ5이 방법은 상충되는 인간의 선호를 다루는 데 있어 표준 지도 미세조정 및 단일 정책 RLHF보다 뛰어나게 성능을 발휘하는가?

주요 결과

  • Rewarded Soup는 요약 작업에서 다중목적 강화학습(MORL)과 동등한 성능을 달성하며, 훈련 비용의 일부분으로서 MORL의 파레토 프론트를 재현한다.
  • 요약 및 질의응답과 같은 텍스트-투-텍스트 작업에서는 두 개의 보상 모델(예: 간결성과 유창성)을 사용한 RS가 매끄러운 트레이드오프 곡선을 보이며, 최적의 λ 선택이 다양한 메트릭에서 뛰어난 성능을 낸다.
  • VQA 및 이미지 캡션 생성과 같은 시각 작업에서는 BLEU와 METEOR 보상으로 구성된 RS가 개별적으로 미세조정된 모델과 교차엔트로피 기반 베이스라인을 모두 능가하며, 더 나은 일반화 성능을 보여준다.
  • 연속 제어(운동 제어) 작업에서는 '위험한'(속도 전용) 및 '신중한'(속도에서 액션 비용을 뺀) 보상으로 구성된 RS가 개별 정책보다 더 매끄럽고 강건한 운동을 달성한다.
  • 이 방법은 모odal 간 일반화가 가능하다: 텍스트 전용, 텍스트-이미지, 제어 작업 전반에서 효과적이며, 단일 도메인을 넘어서 광범위하게 적용 가능함을 보여준다.
  • 독립적으로 미세조정된 모델의 가중치를 선형으로 보간함으로써 다양한 목적에 걸쳐 성능이 유지되며, 가중치 공간 내 선형 연결성의 핵심 가정이 검증됨을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.