Skip to main content
QUICK REVIEW

[논문 리뷰] RLCD: Reinforcement Learning from Contrastive Distillation for Language Model Alignment

Kevin Yang, Dan Klein|arXiv (Cornell University)|2023. 07. 24.
Topic Modeling인용 수 4
한 줄 요약

RLCD는 대조적 프롬프팅을 통해 합성된 선호도 쌍을 생성함으로써 인간 피드백 없이 언어 모델의 정렬을 위한 새로운 방법을 제안한다: 긍정적 및 부정적 프롬프트를 사용하여 대조적인 출력을 생성하고, 긍정적 출력을 선호된 것으로 자동으로 레이블링한다. 이 방법은 레이블 노이즈를 감소시키고, 7B 및 30B 모델 규모에서 유해성, 유용성, 스토리 생성 작업 전반에서 RLAIF 및 컨텍스트 디스틸레이션 기준보다 정렬 성능을 향상시킨다.

ABSTRACT

We propose Reinforcement Learning from Contrastive Distillation (RLCD), a method for aligning language models to follow principles expressed in natural language (e.g., to be more harmless) without using human feedback. RLCD creates preference pairs from two contrasting model outputs, one using a positive prompt designed to encourage following the given principles, and one using a negative prompt designed to encourage violating them. Using two different prompts causes model outputs to be more differentiated on average, resulting in cleaner preference labels in the absence of human annotations. We then use the preference pairs to train a preference model, which is in turn used to improve a base unaligned language model via reinforcement learning. Empirically, RLCD outperforms RLAIF (Bai et al., 2022b) and context distillation (Huang et al., 2022) baselines across three diverse alignment tasks--harmlessness, helpfulness, and story outline generation--and when using both 7B and 30B model scales for simulating preference data.

연구 동기 및 목표

  • 언어 모델 정렬을 위한 인간에 의한 선호도 데이터 수집의 높은 비용과 확장성 한계를 해결하기 위해.
  • 강화학습에서 사용하는 합성된 선호도 데이터의 품질을 향상시키기 위해 레이블 노이즈를 감소시키기 위해.
  • RLAIF(쌍별 선호도)와 컨텍스트 디스틸레이션(방향성 속성 제어)의 장점을 하나의 프레임워크에 통합하기 위해.
  • 오직 LLM이 생성한 선호도 신호만을 사용하여 대규모 언어 모델의 효과적인 정렬을 가능하게 하기 위해.
  • 대조적 프롬프트 엔지니어링이 표준 RLAIF 또는 컨텍스트 디스틸레이션보다 더 높은 품질의 선호도 데이터를 생성할 수 있음을 입증하기 위해.

제안 방법

  • 긍정적 프롬프트 $p_{+}$와 부정적 프롬프트 $p_{-}$를 생성하여 원하는 속성(예: 유용성)을 장려하거나 억제한다.
  • 기본 언어 모델을 사용하여 $p_{+}$와 $p_{-}$에서 각각 출력 $(o_{+}, o_{-})$를 생성한다.
  • 자동으로 $o_{+}$를 선호된 것으로, $o_{-}$를 비선호된 것으로 레이블링하여 합성된 쌍별 선호도 데이터를 형성한다.
  • 생성된 합성된 선호도 쌍을 기반으로 선호도 모델을 훈련하여 상대적 품질을 예측한다.
  • 선호도 모델의 보상 신호를 사용하여 PPO를 통해 대상 언어 모델을 피지터링한다.
  • 선호도 쌍 생성과 정렬에 동일한 모델을 사용함으로써, 피드백이 없는 확장 가능한 훈련을 가능하게 한다.

실험 결과

연구 질문

  • RQ1대조적 프롬프팅을 통해 생성된 합성된 선호도 쌍이 표준 RLAIF보다 정렬 품질 측면에서 뛰어나게 되는가?
  • RQ2긍정적 및 부정적 프롬프트를 모두 사용할 경우, 표준 RLAIF에 비해 선호도 데이터의 신호 대 노이즈 비율이 향상되는가?
  • RQ3대조적 디스틸레이션은 쌍별 강화학습의 이점을 유지하면서도 컨텍스트 디스틸레이션보다 더 나은 정렬 성능을 달성할 수 있는가?
  • RQ4RLCD는 유해성, 유용성, 창의적 생성과 같은 다양한 정렬 작업에서 어떻게 성능을 발휘하는가?
  • RQ5이 방법은 인간 피드백 없이도 더 큰 모델 규모(예: 30B)로 효과적으로 확장되는가?

주요 결과

  • RLCD는 인간 평가에서 모든 세 가지 정렬 작업(유해성, 유용성, 스토리 초안 생성)에서 RLAIF 및 컨텍스트 디스틸레이션 기준보다 뛰어난 성능을 보였다.
  • 7B 모델 규모에서 RLCD는 쌍별 비교에서 뛰어난 성능을 보이며, 더 높은 품질의 선호도 신호임을 시사했다.
  • 30B 모델 규모에서 RLCD는 기준보다 유지 또는 초월하는 성능을 유지하며 확장성을 입증했다.
  • 출력 $o_{+}$와 $o_{-}$ 간의 품질 대비를 강화함으로써 레이블 노이즈를 감소시켜 보다 신뢰할 수 있는 선호도 모델링을 가능하게 했다.
  • 긍정적 및 부정적 프롬프트를 모두 사용함으로써 컨텍스트 디스틸레이션(단지 긍정적 신호만 사용)보다 더 풍부한 감독을 제공했다.
  • 이 방법은 인간 피드백 없이도 효과적인 정렬을 가능하게 하여 대규모 비용 효율적인 LLM 정렬에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.