[논문 리뷰] Can Wikipedia Help Offline Reinforcement Learning?
이 논문은 오프라인 강화학습에서 강화학습을 순서 모델링으로 간주함으로써, GPT2 및 위키백과 기반으로 훈련된 ChibiT와 같은 사전 훈련된 언어 모델을 미세조정하는 방법을 제안한다. 이는 D4RL Gym 및 아케이드 벤치마크에서 3-6배 빠른 훈련 속도와 최신 기술 수준(SOTA) 성능을 달성하며, 자연어 사전 훈련에서 강화학습 작업으로의 강력한 전이 성능을 입증한다.
Fine-tuning reinforcement learning (RL) models has been challenging because of a lack of large scale off-the-shelf datasets as well as high variance in transferability among different environments. Recent work has looked at tackling offline RL from the perspective of sequence modeling with improved results as result of the introduction of the Transformer architecture. However, when the model is trained from scratch, it suffers from slow convergence speeds. In this paper, we look to take advantage of this formulation of reinforcement learning as sequence modeling and investigate the transferability of pre-trained sequence models on other domains (vision, language) when finetuned on offline RL tasks (control, games). To this end, we also propose techniques to improve transfer between these domains. Results show consistent performance gains in terms of both convergence speed and reward on a variety of environments, accelerating training by 3-6x and achieving state-of-the-art performance in a variety of tasks using Wikipedia-pretrained and GPT2 language models. We hope that this work not only brings light to the potentials of leveraging generic sequence modeling techniques and pre-trained models for RL, but also inspires future work on sharing knowledge between generative modeling tasks of completely different domains.
연구 동기 및 목표
- 비어 있는 도메인(예: 언어)에서 사전 훈련된 순서 모델이 오프라인 강화학습 성능에 기여할 수 있는지 조사하기 위해.
- Transformer 기반 오프라인 RL 모델을 랜덤 초기화로부터 처음부터 훈련할 때 느린 수렴 문제를 해결하기 위해.
- 언어 모델링에서 학습된 특징들이 오프라인 RL의 제어 및 게임 환경으로 전이 가능한지 탐색하기 위해.
- 확장된 위치 임베딩 및 임베딩 유사성 장려와 같은 기법을 통해 언어와 RL 도메인 간의 특징 전이를 향상시키기 위해.
- 대규모 자연어 데이터에서의 사전 훈련이 조건부 모달리티 경계를 넘어 오프라인 RL에 효과적인 인덕티브 바이어스로 작용할 수 있음을 입증하기 위해.
제안 방법
- 수익을 조건으로 삼는다.
- 사전 훈련된 자동회귀 언어 모델(예: GPT2, ChibiT)을 오프라인 RL 데이터셋에 대해 순서 모델링 목적을 사용하여 미세조정한다.
- 비언어적 순서에서 시간적 구조를 더 잘 포착하기 위해 확장된 위치 임베딩을 도입한다.
- 미세조정 중 언어 및 RL 순서의 표현 공간을 정렬하기 위해 임베딩 유사성 장려를 적용한다.
- 상태, 보상 및 수익을 기반으로 행동을 자동으로 순차적으로 모델링하기 위해 인과 마스킹을 사용하는 표준 Transformer 디코더 아키텍처를 사용한다.
- 예측된 행동과 실제 행동 간의 평균 제곱오차 손실을 사용하여 오프라인 데이터셋에서 모델을 엔드 투 엔드로 훈련한다.
실험 결과
연구 질문
- RQ1위키백과나 유사한 코퍼스에서 사전 훈련된 언어 모델이 제어 및 게임 환경에서 오프라인 강화학습 작업으로 효과적으로 전이될 수 있는가?
- RQ2랜덤 초기화보다 자연어에서의 사전 훈련이 오프라인 RL에서 수렴 속도와 최종 성능을 향상시키는가?
- RQ3예: 위치 임베딩 확장, 표현 정렬 등과 같은 기법들이 언어에서 RL 순서 모델링으로의 전이를 향상시키는가?
- RQ4모델 크기와 사전 훈련 도메인(언어 대 비전)이 오프라인 RL 성능에 미치는 영향은 무엇인가?
- RQ5언어에서 RL로의 도메인 간 전이를 가능하게 하는 통합된 인덕티브 바이어스가 순서 모델링에 존재하는가?
주요 결과
- GPT2와 위키백과 기반으로 훈련된 ChibiT 모델을 오프라인 RL 작업에 미세조정하면 D4RL Gym 및 아케이드 벤치마크에서 최신 기술 수준 성능을 달성한다.
- 제안된 방법은 기존의 순수한 결정 트랜스포머를 랜덤 초기화로부터 훈련하는 것보다 3-6배 빠른 훈련 속도를 제공하며, 훈련 시간을 수 시간에서 수십 분으로 단축시킨다.
- 자연어에서의 사전 훈련은 시각 기반 사전 훈련이나 랜덤 초기화보다 유의미하게 뛰어난 성능을 내며, 언어 특화 인덕티브 바이어스가 유용함을 시사한다.
- 위치 임베딩을 확장하고 언어 및 RL 순서 간의 임베딩 유사성을 장려함으로써 미세조정 중 성능과 안정성이 향상된다.
- 다양한 환경에서 일관된 성능 향상이 관찰되어, 작업이나 도메인에 관계없이 강력한 전이 가능성임을 나타낸다.
- 모든 파라미터를 미세조정하는 것이 일부 파라미터를 동결하는 것보다 더 좋은 성능을 내며, RL 분포에 대한 적응의 중요성을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.