Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding the performance gap between online and offline alignment algorithms

Yunhao Tang, Daniel Guo|arXiv (Cornell University)|2024. 05. 14.
Genomics and Phylogenetic StudiesBiochemistry, Genetics and Molecular Biology인용 수 3
한 줄 요약

이 논문은 대규모 언어 모델 정렬에서 온라인 강화학습에서의 인간 피드백(RLHF)이 오프라인 정렬 방법보다 성능이 뛰어나지만, 오프라인 방법은 계산 비용이 더 낮은 데도 불구하고 그 이유를 조사한다. 통제된 아블레이션 실험을 통해 온라인 방법의 우수한 생성 성능의 핵심 요인으로 온정책(온정책) 데이터 생성을 규명하였으며, 오프라인 알고리즘들이 해결하지 못하는, 분류 능력과 생성 능력 사이의 근본적 트레이드오프를 드러낸다.

ABSTRACT

Reinforcement learning from human feedback (RLHF) is the canonical framework for large language model alignment. However, rising popularity in offline alignment algorithms challenge the need for on-policy sampling in RLHF. Within the context of reward over-optimization, we start with an opening set of experiments that demonstrate the clear advantage of online methods over offline methods. This prompts us to investigate the causes to the performance discrepancy through a series of carefully designed experimental ablations. We show empirically that hypotheses such as offline data coverage and data quality by itself cannot convincingly explain the performance difference. We also find that while offline algorithms train policy to become good at pairwise classification, it is worse at generations; in the meantime the policies trained by online algorithms are good at generations while worse at pairwise classification. This hints at a unique interplay between discriminative and generative capabilities, which is greatly impacted by the sampling process. Lastly, we observe that the performance discrepancy persists for both contrastive and non-contrastive loss functions, and appears not to be addressed by simply scaling up policy networks. Taken together, our study sheds light on the pivotal role of on-policy sampling in AI alignment, and hints at certain fundamental challenges of offline alignment algorithms.

연구 동기 및 목표

  • 온라인 및 오프라인 정렬 알고리즘 간의 성능 격차의 근본 원인을 대규모 언어 모델 정렬 분야에서 규명하는 것.
  • 데이터 커버리지, 데이터 품질, 최적화 동역학, 손실 함수, 모델 스케일링 등이 관찰된 성능 격차를 설명하는지 평가하는 것.
  • 개선된 데이터 생성 또는 아키텍처 스케일링을 통해 오프라인 알고리즘이 온라인 방법과 동등한 성능을 낼 수 있는지 판단하는 것.
  • 정책 최적화에서 분류 능력(쌍별 분류)과 생성 능력(텍스트 생성) 간의 상호작용을 이해하는 것.

제안 방법

  • 온라인 및 오프라인 알고리즘 간의 공정한 비교를 위해 RLHF 정책와 지도 미세조정(SFT) 정책 간의 KL 발산을 통합 예산 측도로 사용하였다.
  • 데이터 분포, 품질, 최적화 절차, 손실 함수와 관련된 가설을 시험하기 위해 통제된 아블레이션 실험을 수행하였다.
  • 동일한 KL 예산 제약 조건 하에서 오픈소스 데이터셋을 사용해 온라인 알고리즘(PPO 등)과 오프라인 알고리즘(DPO 등)을 비교하였다.
  • 성능 격차에 대한 영향을 평가하기 위해 대조적 손실 함수와 비대조적 손실 함수를 모두 평가하였다.
  • 초기 정책에 가까운 분포를 가진 합성 오프라인 데이터셋을 생성하여 온정책 데이터 수집을 시뮬레이션하였다.
  • 쌍별 분류 정확도(분류 능력)와 생성 품질(생성 능력) 측도를 통해 성능을 측정하였다.

실험 결과

연구 질문

  • RQ1동일한 KL 예산 조건에서 온라인 정렬 알고리즘이 왜 항상 오프라인 알고리즘을 능가하는가?
  • RQ2데이터 커버리지와 데이터 품질이 온라인 및 오프라인 방법 간의 성능 격차를 어느 정도 설명하는가?
  • RQ3오프라인 정책 최적화에서 분류 능력과 생성 능력 간에 근본적인 트레이드오프가 존재하는가?
  • RQ4성능 격차가 대조적 손실 함수와 비대조적 손실 함수, 그리고 모델 스케일링에 관계없이 지속되는가?
  • RQ5온정책 분포를 모방하는 데이터를 생성함으로써 오프라인 알고리즘의 성능을 향상시킬 수 있는가?

주요 결과

  • 온라인 알고리즘은 모든 KL 예산 수준에서 오프라인 알고리즘을 일관되게 능가하며, 생성 및 분류 작업 모두에서 더 높은 최고 성능을 기록한다.
  • 오프라인 데이터 커버리지와 품질만으로는 성능 격차를 설명할 수 없으며, 고품질·고커버리지 데이터셋조차도 격차를 메울 수 없다.
  • 오프라인 정책는 쌍별 분류에서는 더 나은 성능을 보이나 텍스트 생성에서는 현저히 열등하여, 분류 성능와 생성 성능 간의 강한 단절을 보여준다.
  • 온라인 정책는 온정책 샘플링 덕분에 지속적으로 분포를 이동시켜 생성 품질을 향상시키며, 이는 정적 오프라인 데이터에는 존재하지 않는 메커니즘이다.
  • 성능 격차는 대조적 및 비대조적 손실 함수 모두에서 지속되며, 이는 특정 최적화 목표의 산물이 아니라는 것을 시사한다.
  • 정책 네트워크의 스케일링은 성능 격차를 해결하지 못하며, 이는 아키텍처 용량만으로는 오프라인 학습의 한계를 극복할 수 없다는 것을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.