Skip to main content
QUICK REVIEW

[논문 리뷰] Personalized Soups: Personalized Large Language Model Alignment via Post-hoc Parameter Merging

Joel Jang, Seungone Kim|arXiv (Cornell University)|2023. 10. 17.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 다중목표 강화학습(MORL)을 통해 개인화된 사용자 선호도에 효율적으로 맞춤형으로 대규모 언어 모델(LLM)을 정렬할 수 있는 후행적 파라미터 병합 방법인 Personalized Soups를 제안한다. 서로 다른 선호도에 대해 별도의 정책 모델을 훈련하고 추론 시에 그 파라미터를 병합함으로써, 선호도 수에 따라 지수적에서 선형으로 증가하는 계산 비용을 감소시키면서도 강력한 기준 모델과 경쟁 가능한 성능을 달성한다. 이는 새로운 사용자 선호도를 재훈련 없이도 동적으로 통합할 수 있도록 한다.

ABSTRACT

While Reinforcement Learning from Human Feedback (RLHF) aligns Large Language Models (LLMs) with general, aggregate human preferences, it is suboptimal for learning diverse, individual perspectives. In this work, we study Reinforcement Learning from Personalized Human Feedback (RLPHF) problem, wherein LLMs are aligned to multiple (sometimes conflicting) preferences by modeling alignment as a Multi-Objective Reinforcement Learning (MORL) problem. Compared to strong single-objective baselines, we show that we can achieve personalized alignment by decomposing preferences into multiple dimensions. These dimensions are defined based on personalizations that are declared as desirable by the user. In this work, we show that they can be efficiently trained independently in a distributed manner and combined effectively post-hoc through parameter merging. The code is available at https://github.com/joeljang/RLPHF.

연구 동기 및 목표

  • 표준 RLHF의 한계를 해결하기 위해, 일반 인구집단의 선호도에 최적화되며 개인적이고 다면적인 사용자 선호도를 반영하지 못하는 문제를 해결한다.
  • 충돌하거나 다양한 선호도를 동시에 최적화할 수 있도록, 개인화된 정렬을 다중목표 강화학습(MORL) 문제로 모델링한다.
  • 다중 선호도 모델의 훈련에 따른 계산 부담을 줄이기 위해 훈련과 병합을 분리하고, 사전 훈련된 정책 헤드의 후행적 병합을 가능하게 한다.
  • 모델 전체를 재훈련하지 않고도 새로운 사용자 선호도를 동적으로 통합할 수 있도록 하여 모odularity와 사용자 통제력을 향상시킨다.

제안 방법

  • 각 사용자 선호도 차원을 별개의 목표로 간주하여 개인화된 정렬을 다중목표 강화학습(MORL) 문제로 공식화한다.
  • 각 선호도 차원에 해당하는 별도의 보상 신호에 대해 Proximal Policy Optimization(PPO)를 사용해 개별 정책 모델을 훈련한다.
  • 후행적 파라미터 병합 기법인 Personalized Soups를 활용하여, 추론 시에 여러 사전 훈련된 정책 모델의 파라미터를 볼록 조합으로 통합한다.
  • 병합 과정은 추론 도중 실시간으로 수행되며, 재훈련 없이도 선호도의 민첩한 조합이 가능하다.
  • 다중 작업 훈련이 필요 없도록 하여, 많은 수의 선호도로의 효율적 확장이 가능하다.
  • 기존의 정책 헤드와 새로운 정책 헤드를 단순히 병합함으로써 새로운 선호도의 동적 추가가 가능하며, 모듈성을 유지한다.
Figure 1: Current RLHF only tackles general alignment while RL $\mathcal{P}$ HF is able to take into account multifaceted human preferences, thus providing a more personalized form of model-to-human alignment.
Figure 1: Current RLHF only tackles general alignment while RL $\mathcal{P}$ HF is able to take into account multifaceted human preferences, thus providing a more personalized form of model-to-human alignment.

실험 결과

연구 질문

  • RQ1개인화된 LLM 정렬이 다중목표 강화학습(MORL) 문제로 효과적으로 모델링될 수 있는가? 이는 다양하고 상충 가능한 사용자 선호도를 포괄할 수 있는가?
  • RQ2다양한 개인화된 선호도를 위한 모델 훈련 및 배포의 계산 비용을 지수적 복잡도에서 선형 복잡도로 줄일 수 있는가?
  • RQ3독립적으로 훈련된 정책 모델의 후행적 파라미터 병합이 종단간 다중목표 훈련과 비교해 유사한 성능을 달성할 수 있는가?
  • RQ4초기 훈련 기간 동안 관찰되지 않은 새로운 사용자 선호도를 통합할 때 이 방법은 얼마나 잘 확장되는가?
  • RQ5Personalized Soups는 톤, 길이, 공손성 수준 등의 출력 특성에 대한 사용자 통제를 유지하면서도 높은 성능을 유지할 수 있는가?

주요 결과

  • Personalized Soups는 강력한 Prompted-MORL 기준 모델(다중목표 RL 접근법)과 경쟁 가능한 성능을 달성하면서도, 선호도 수에 따라 지수적에서 선형으로 증가하는 계산 복잡도를 감소시킨다.
  • 재훈련 없이도 파라미터 병합을 통해 다수의 개인화된 선호도를 효율적이고 실시간으로 조합할 수 있다.
  • 실험 결과, 새로운 선호도가 훈련 후에 도입되더라도 높은 성능을 유지하면서도 동적 통합이 가능함을 보여준다.
  • 모듈러한 설계 덕분에 각 선호도에 대해 별도의 정책 모델을 훈련할 수 있으며, 공동 최적화 대비 훈련 오버헤드를 크게 감소시킨다.
  • 감성, 간결성, 공손성 수준과 같은 세부적인 사용자 특화 선호도를 포착하는 데 있어, 지도형 미세조정과 표준 RLHF보다 뛰어난 성능을 보였다.
  • 평가에서 16개의 서로 다른 선호도 조합에 대한 추상화 분석 결과, 다양한 선호도 조합에 대해 뛰어난 강건성을 입증했다.
Figure 2: Reward model training with conflicting preferences.
Figure 2: Reward model training with conflicting preferences.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.