Skip to main content
QUICK REVIEW

[논문 리뷰] Representation Matters: Offline Pretraining for Sequential Decision Making

Mengjiao Yang, Ofir Nachum|arXiv (Cornell University)|2021. 02. 11.
Reinforcement Learning in Robotics참고 문헌 49인용 수 22
한 줄 요약

이 논문은 오프라인 데이터셋에서 대비적 자기예측을 통한 사전 훈련을 통해 상태 표현을 학습하여 다운스트림 순차적 결정 문제의 성능을 향상시키는 방법을 제안한다. 상태, 행동, 보상의 부분 트레이젝터리에서 불변이며 예측 가능한 표현을 학습함으로써, 이 방법은 모방 학습, 오프라인 강화학습, 온라인 강화학습에서 성능을 크게 향상시킨다. 이는 표현 학습이 다양한 강화학습 환경에서 데이터 효율적인 정책 학습의 강력한 기반으로 기능할 수 있음을 보여준다.

ABSTRACT

The recent success of supervised learning methods on ever larger offline datasets has spurred interest in the reinforcement learning (RL) field to investigate whether the same paradigms can be translated to RL algorithms. This research area, known as offline RL, has largely focused on offline policy optimization, aiming to find a return-maximizing policy exclusively from offline data. In this paper, we consider a slightly different approach to incorporating offline data into sequential decision-making. We aim to answer the question, what unsupervised objectives applied to offline datasets are able to learn state representations which elevate performance on downstream tasks, whether those downstream tasks be online RL, imitation learning from expert demonstrations, or even offline policy optimization based on the same offline dataset? Through a variety of experiments utilizing standard offline RL datasets, we find that the use of pretraining with unsupervised learning objectives can dramatically improve the performance of policy learning algorithms that otherwise yield mediocre performance on their own. Extensive ablations further provide insights into what components of these unsupervised objectives -- e.g., reward prediction, continuous or discrete representations, pretraining or finetuning -- are most important and in which settings.

연구 동기 및 목표

  • 오프라인 데이터셋에서의 비지도 표현 학습이 다양한 다운스트림 순차적 결정 문제에서 성능 향상에 기여하는지 조사하기.
  • 특히 대비적 자기예측과 같은 비지도 목표 중에서 정책 학습에 가장 효과적인 상태 표현을 제공하는 목표를 규명하기.
  • 표준 D4RL 벤치마크를 사용하여 표현 학습이 모방 학습, 오프라인 강화학습, 온라인 강화학습에 미치는 영향을 평가하기.
  • 표현 학습의 구성 요소들(예: 행동/보상 예측, 네트워크 아키텍처, 피니튜닝) 중 성능에 가장 중요한 요소를 특정하기.
  • 특정 표현 목표가 다양한 강화학습 철학에 어떻게 일반화되는지에 대한 경험적 통찰 제공하기.

제안 방법

  • 오프라인 데이터의 부분 트레이젝터리에서 대비적 자기예측을 사용하여 원시 관측값을 고정 길이의 임베딩으로 매핑하는 신경망 인코더 φ(s)를 사전 훈련한다.
  • 양의 쌍(예: 상태 및 행동의 시퀀스와 다음 상태) 간의 일치를 최대화하고 음의 쌍 간의 일치를 최소화하기 위해 대비 손실을 적용한다.
  • 모방 학습, 오프라인 강화학습, 온라인 강화학습 환경에서 다운스트림 정책 네트워크의 입력으로 사전 훈련된 표현 φ(s)를 사용한다.
  • 다양한 아키텍처(예: 트랜스포머)와 훈련 전략(예: 피니튜닝, 모멘텀 네트워크)을 사용하여 행동 및 보상 예측을 포함한 다양한 대비 목표의 변형을 평가한다.
  • 행동/보상 포함 여부, 이중방향 트랜스포머 사용 여부, 컨텍스트 임베딩, 보조 손실의 영향을 분리하기 위해 아블레이션 스터디를 수행한다.
  • 아블레이션의 기초로 강력한 경험적 성능를 보인 트랜스포머 기반 ACL 목표의 구현을 사용한다.

실험 결과

연구 질문

  • RQ1오프라인 데이터셋에서의 비지도 표현 학습이 모방 학습, 오프라인 강화학습, 온라인 강화학습에서 성능 향상에 기여하는가?
  • RQ2특히 대비적 자기예측과 같은 특정 비지도 목표 중에서 다양한 강화학습 작업에서 가장 효과적인 상태 표현을 제공하는 것은 무엇인가?
  • RQ3행동/보상 예측, 네트워크 아키텍처, 피니튜닝 전략과 같은 구성 요소들이 다운스트림 성능에 어떤 영향을 미치는가?
  • RQ4NLP나 온라인 강화학습에서 잘 작동하는 표현 학습 목표가 오프라인 강화학습 환경으로 일반화되는가?
  • RQ5모든 다운스트림 작업에서 잘 작동하는 유일한 최적의 표현 목표가 존재하는가, 아니면 성능은 작업 유형에 따라 달라지는가?

주요 결과

  • 특히 상태와 행동의 시퀀스에서 미래 상태를 예측하는 대비적 자기예측 목표는 모방 학습, 오프라인 강화학습, 온라인 강화학습 전반에서 뚜렷한 성능 향상을 이룬다.
  • 모방 학습은 상태 전용 대비 학습에서 가장 큰 이점을 얻지만, 오프라인 및 온라인 강화학습은 예측 목표에 행동과 보상을 포함할수록 성능이 향상된다.
  • 표현 φ(s)에서 행동과 보상을 재구성하는 것은 강화학습 환경에서는 일관되게 성능 향상을 이끌지만, 모방 학습 성능을 떨어뜨리며, 이는 목표 간의 상충 관계를 시사한다.
  • NLP에서 흔히 사용되는 컨텍스트 임베딩과 이중방향 트랜스포머는 모방 학습에서 성능을 떨어뜨리며, 강화학습에서는 혼합된 결과를 보이며, 이는 오프라인 강화학습에서 반드시 유리하지 않음을 시사한다.
  • 온라인 강화학습에서 표현 목표를 보조 손실로 사용하면 성능 향상이 이루어지지만, 오프라인 강화학습에서는 심각한 성능 저하를 초래하며, 이는 온라인과 오프라인 훈련 동역학 간의 근본적인 불일치를 드러낸다.
  • 표현 네트워크의 피니튜닝은 일부 도메인에서 온라인 강화학습 성능을 향상시키지만, 모방 학습 및 오프라인 강화학습에서는 약간의 성능 저하를 초래하며, 이는 작업에 따라 민감한 특성을 보임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.