Skip to main content
QUICK REVIEW

[논문 리뷰] Personalized Language Modeling from Personalized Human Feedback

Xinyu Li, Zhou, Ruiyang|arXiv (Cornell University)|2024. 02. 06.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 개인화된 강화학습을 통한 인간의 피드백(개인화된-RLHF, P-RLHF)을 제안하며, 대규모 언어모델을 개인 사용자 선호도에 맞추기 위해 사용자 모델과 개인화된 언어/보상 모델을 동시에 학습하는 프레임워크를 개발한다. 사용자 고유의 임bedding과 개인화된 보상 모델링(P-RM) 및 직접 선호도 최적화(P-DPO)를 위한 새로운 학습 목표를 통합함으로써, 기록된 사용자뿐 아니라 미기록된 사용자에 대해서도 보다 나은 일치를 달성하며, 개인화된 선호도 예측에서 최대 61.72%의 정확도를 기록하여 비개인화된 기준 모델을 능가한다.

ABSTRACT

Personalized large language models (LLMs) are designed to tailor responses to individual user preferences. While Reinforcement Learning from Human Feedback (RLHF) is a commonly used framework for aligning LLMs with human preferences, vanilla RLHF assumes that all human preferences share the same distribution, preventing fine-tuned LLMs from generating personalized content when user preferences are diverse. In this work, we propose Personalized-RLHF (P-RLHF), an efficient framework that utilizes a lightweight user model to capture individual user preferences and jointly learns the user model and the personalized LLM from human feedback. P-RLHF exhibits the following three characteristics: (1) It enables an LLM to generate personalized content and scale efficiently with growing number of users. (2) It handles both explicit user preferences described as textual input and implicit user preferences encoded in the feedback data. (3) It eliminates the need for users to fully articulate their preferences, which are normally needed for prompting LLMs to generate personalized content yet are often impractical to obtain in real-world scenarios. Our experimental results show that personalized LLMs trained using P-RLHF generate responses that are more closely aligned with individual user preferences, outperforming vanilla, non-personalized RLHF and prompting-based personalization approaches across different tasks. We opensource our code at https://github.com/HumainLab/Personalized_RLHF.

연구 동기 및 목표

  • 대규모 언어모델에서 다양하고 개인화된 인간 선호도를 다루는 데에 있어 일반적인 RLHF의 한계를 해결하기 위해.
  • 개인별로 상당히 다를 수 있는 사용자 선호도가 존재하는 상황에서 개인화된 인간 피드백에서 학습하는 작업을 정식화하기 위해.
  • 사용자 표현과 개인화된 보상/언어 모델을 동시에 학습하는 일반적인 P-RLHF 프레임워크를 개발하기 위해.
  • 개인화된 보상 모델링(P-RM)과 개인화된 직접 선호도 최적화(P-DPO)를 위한 새로운 학습 목표를 설계하기 위해.
  • 실제 텍스트 요약 데이터셋에 사용자 선호도가 주석 처리된 자료를 활용해 프레임워크를 평가함으로써, 개인 사용자와의 일치도 향상을 입증하기 위해.

제안 방법

  • 사용자 신원이 주석 처리된 선호도 데이터를 사용하여 사용자 모델과 언어/보상 모델을 동시에 훈련하는 P-RLHF 프레임워크를 제안한다.
  • 사용자 정보(예: 작업자 ID)를 사용자 고유의 임베딩으로 매핑하는 사용자 모델을 설계하며, 개인 또는 클러스터 기반 표현 방식을 선택할 수 있다.
  • 사용자 고유의 손실 항목과 사용자에 관계없이 동일한 손실 항목을 조합한 개인화된 보상 모델링 목표(P-RM)를 도입하며, 하이퍼파라미터 α로 가중치를 조절한다.
  • 사용자 조건부 은닉 보상 함수를 사용하여 언어 모델을 최적화하는 개인화된 DPO 목표(P-DPO)를 개발한다.
  • 개인화된 선호도 적합성과 일반 사용자 표현(e₀)에 의한 정규화를 균형 잡는 하이브리드 손실을 P-RM 및 P-DPO에 적용한다.
  • 기본 언어 모델로 GPT-J 6B를 사용하며, 10명의 평가자들이 참여한 실세계 텍스트 요약 데이터셋에서 P-RM 및 P-DPO를 통해 미세조정한다.

실험 결과

연구 질문

  • RQ1통합된 프레임워크가 사용자 표현과 개인화된 보상 모델을 동시에 학습하여 개인 선호도에 대한 일치도를 향상시킬 수 있는가?
  • RQ2사용자 고유의 임베딩을 통합할 경우, 비개인화된 기준 모델 대비 선호도 모델링 성능에 어떤 영향을 미치는가?
  • RQ3P-RM 및 P-DPO 목표에서 사용자에 관계없이 동일한 손실 항목(α)이 미기록된 사용자에 대한 일반화에 어떤 영향을 미치는가?
  • RQ4개별 모델 대비 클러스터 기반 모델 설계(개별 vs. 클러스터)가 개인화 성능과 내구성에 어떤 영향을 미치는가?
  • RQ5일반 사용자 표현(e₀)을 사용하여 미기록된 사용자에게 효과적으로 언어 모델 출력을 맞춤화할 수 있는가?

주요 결과

  • 개별 사용자 임베딩과 α=0.5를 사용한 P-RM 모델은 기록된 사용자에 대해 상위 1개의 선호도 예측에서 61.72%의 정확도를 기록하며, 일반 RM(60.27%)를 능가했다.
  • 개별 사용자 임베딩과 α=0.5를 사용한 P-DPO 모델은 기록된 사용자에 대해 61.33%의 정확도, 미기록된 사용자에 대해선 61.97%의 정확도를 기록하며, 일반 DPO 기준 모델(60.48% 및 60.99%)을 모두 초월했다.
  • 사용자에 관계없이 동일한 손실 항목(α=0.5)이 일반화에 크게 기여했으며, 모든 평가 지표에서 α=0.5를 사용한 모델이 α=1.0을 사용한 모델보다 성능이 뛰어났다.
  • K=5인 클러스터 기반 사용자 모델은 개별 모델과 유사한 성능을 보였지만, 더 높은 분산을 보였으며, 보다 나은 하이퍼파라미터 튜닝이나 도메인 인식 기반 클러스터링을 통해 향상 가능성이 있음을 시사했다.
  • 일반 사용자 표현(e₀)은 미기록된 사용자에 대한 효과적인 개인화를 가능하게 했으며, P-DPO는 미기록된 사용자에 대해 61.97%의 정확도를 기록하여 일반 DPO 기준 모델을 뛰어넘었다.
  • 결과적으로, 사용자 표현을 통해 사용자 선호도를 명시적으로 모델링할 경우, 표준 RLHF 접근 방식보다 개인 선호도에 더 잘 맞는다는 것이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.