Skip to main content
QUICK REVIEW

[논문 리뷰] Offline RL for Natural Language Generation with Implicit Language Q Learning

Charlie Snell, Ilya Kostrikov|arXiv (Cornell University)|2022. 06. 05.
Topic Modeling인용 수 9
한 줄 요약

이 논문은 사용자가 지정한 보상 함수를 최적화하기 위해 정적이고 열등한 데이터셋만을 사용하는 새로운 오프라인 강화학습 방법인 암묵적 언어 Q-학습(ILQL)을 제안한다. ILQL은 가치 보존성과 암묵적 데이터셋 지원 제약 조건을 결합하여 학습을 안정화시키고, 온라인 상호작용 없이도 효과적인 정책 학습을 가능하게 하며, 독성 콘텐츠 탐지 및 대화 생성과 같은 객관적이고 주관적인 보상 함수 모두에서 뛰어난 성능을 달성한다.

ABSTRACT

Large language models distill broad knowledge from text corpora. However, they can be inconsistent when it comes to completing user specified tasks. This issue can be addressed by finetuning such models via supervised learning on curated datasets, or via reinforcement learning. In this work, we propose a novel offline RL method, implicit language Q-learning (ILQL), designed for use on language models, that combines both the flexible utility maximization framework of RL algorithms with the ability of supervised learning to leverage previously collected data, as well as its simplicity and stability. Our method employs a combination of value conservatism alongside an implicit dataset support constraint in learning value functions, which are then used to guide language model generations towards maximizing user-specified utility functions. In addition to empirically validating ILQL, we present a detailed empirical analysis of situations where offline RL can be useful in natural language generation settings, demonstrating how it can be a more effective utility optimizer than prior approaches for end-to-end dialogue, and how it can effectively optimize high variance reward functions based on subjective judgement, such as whether to label a comment as toxic or not.

연구 동기 및 목표

  • 사용자가 지정한 작업에 대응하는 대규모 언어 모델의 정렬 문제를 해결하기 위해, 일반적으로 프롬프트 시 일관성 없이 작동하는 경우가 많은 문제를 다루는 것.
  • 감독 학습 미세조정과 온라인 강화학습의 한계를 극복하기 위해, 정적 데이터셋에서 안정적이고 데이터 효율적인 정책 최적화를 가능하게 하는 것.
  • 시간적 복합성(temportal compositionality)을 지원하는 방법 설계 — 데이터셋에 최적의 예시가 없더라도 최적의 행동을 학습할 수 있도록 하는 것.
  • 독성 분류와 같이 표준 감독 또는 모방 학습 방법으로는 어려운 고분산 또는 주관적인 보상 함수 최적화를 가능하게 하는 것.
  • 학습의 단순성, 확장성, 성능 사이의 균형을 이루어, 오프라인 RL을 실제 NLP 응용 분야에 실용적으로 적용할 수 있도록 하는 것.

제안 방법

  • 레이블이 부여된 보상이 있는 오프라인 데이터를 사용하여 트랜스포머 기반 언어 모델이 상태-행동 Q-값과 상태 값 예측하도록 훈련한다.
  • Q-함수의 상위 기대값(upper-expectile)에 값을 함수를 피팅함으로써 반복적 정책 개선을 수행하여 고성능 정책의 안정적 최적화를 가능하게 한다.
  • 암묵적 데이터셋 지원 제약 조건을 적용하여 정책 출력이 제시된 데이터의 지원 영역 내에 유지되도록 보장함으로써 일반화성과 안정성을 향상시킨다.
  • 학습과 디코딩을 분리하기 위해, 추론 시 likelihood 변형을 통해 표준 언어 모델을 안내할 수 있는 가치 함수를 학습한다.
  • 온도 파라미터(τ)와 β-파라미터를 사용하여 탐색과 정책 엔트로피를 제어함으로써 성능와 다양성 사이의 트레이드오프를 가능하게 한다.
  • 학습 중에 반사적 샘플링이나 외부 언어 모델의 가능성도 의존하지 않아, 학습 복잡성과 종속성 감소를 달성한다.

실험 결과

연구 질문

  • RQ1온라인 상호작용 없이 정적이고 열등한 데이터셋만을 사용하여 오프라인 RL 방법이 언어 모델 행동을 효과적으로 최적화할 수 있는가?
  • RQ2다양한 보상 함수에서 ILQL은 감독 학습 미세조정 및 이전 오프라인 RL 기준선 대비 성능과 안정성 측면에서 어떻게 비교되는가?
  • RQ3데이터셋에 최적의 예시가 없더라도 ILQL은 최적의 행동을 학습할 수 있는가? 이는 시간적 복합성을 입증하는가?
  • RQ4독성 탐지나 인간 선호도 정렬과 같은 주관적 또는 고분산 보상 함수를 ILQL이 효과적으로 최적화할 수 있는가?
  • RQ5성능 향상과 함께 ILQL은 정책 다양성을 어느 정도 유지하는가? 그리고 하이퍼파라미터 β와 τ는 이 트레이드오프에 어떻게 영향을 미치는가?

주요 결과

  • ILQL은 독성 댓글 생성에서 감독 학습 미세조정 및 필터링된 미세조정보다 뛰어난 성능을 보이며, 평균 보상은 -0.01 ± 0.01(β=16)과 0.00 ± 0.00(β=32)를 기록했고, 거의 0에 가까운 엔트로피를 보이며 고품질의 비독성 출력을 생성함을 시사한다.
  • 레딧 댓글 데이터셋에서 ILQL는 τ=0.6과 β=32를 사용하여 9.83 ± 0.04개의 업보트(실제)와 10.00 ± 0.00개의 업보트(모델)를 기록했으며, 단일 스텝 RL 및 미세조정 기준선을 크게 앞서는 성능을 보였다.
  • 인간이 플레이한 워들(Wordle) 데이터셋에서는 ILQL가 τ=0.7과 β=4를 사용하여 보상 -2.23 ± 0.03을 기록했고, 단일 스텝 RL(-2.24 ± 0.03)과 필터링된 미세조정(-2.93 ± 0.06)을 모두 앞서는 성능을 보였다.
  • ILQL는 객관적(예: 대화 성공률) 및 주관적(예: 독성) 보상 함수 모두에서 높은 성능를 유지하며, 강건성을 입증했다.
  • β가 증가함에 따라 ILQL 정책의 성능는 향상되지만 엔트로피는 감소하여 보상 최적화와 출력 다양성 사이의 효과적인 트레이드오프를 보여준다.
  • ILQL는 엔드 투 엔드 대화 및 주관적 보상 최적화 작업에서 최신 기술 수준의 성능를 달성했으며, 이전 오프라인 RL 방법의 높은 복잡성과 불안정성 문제를 피했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.