Skip to main content
QUICK REVIEW

[논문 리뷰] Online and Offline Reinforcement Learning by Planning with a Learned Model

Julian Schrittwieser, Thomas Hubert|arXiv (Cornell University)|2021. 04. 13.
Reinforcement Learning in Robotics참고 문헌 31인용 수 26
한 줄 요약

본 논문은 학습된 모델을 활용하여 학습 타깃을 개선하는 모델 기반 계획 기법인 Reanalyse를 소개합니다. 이를 통해 MuZero가 온라인, 오프라인, 시연 기반 데이터 환경에서 효과적으로 작동하도록 가능하게 하며, 최종적으로 MuZero Unplugged가 온라인 Atari와 오프라인 RL 벤치마크에서 최첨단 결과를 달성합니다.

ABSTRACT

Learning efficiently from small amounts of data has long been the focus of model-based reinforcement learning, both for the online case when interacting with the environment and the offline case when learning from a fixed dataset. However, to date no single unified algorithm could demonstrate state-of-the-art results in both settings. In this work, we describe the Reanalyse algorithm which uses model-based policy and value improvement operators to compute new improved training targets on existing data points, allowing efficient learning for data budgets varying by several orders of magnitude. We further show that Reanalyse can also be used to learn entirely from demonstrations without any environment interactions, as in the case of offline Reinforcement Learning (offline RL). Combining Reanalyse with the MuZero algorithm, we introduce MuZero Unplugged, a single unified algorithm for any data budget, including offline RL. In contrast to previous work, our algorithm does not require any special adaptations for the off-policy or offline RL settings. MuZero Unplugged sets new state-of-the-art results in the RL Unplugged offline RL benchmark as well as in the online RL benchmark of Atari in the standard 200 million frame setting.

연구 동기 및 목표

  • 저장된 데이터를 재사용하여 더 나은 학습 타깃을 생성함으로써 온라인 RL의 데이터 효율성을 향상시키는 것.
  • 환경 상호작용 없이 데이터셋에서 학습함으로써 완전한 오프라인 RL을 가능하게 하는 것.
  • 단일 알고리즘(MuZero Unplugged)이 이산 및 연속 액션 공간에서 온라인, 오프라인 및 시연 기반 학습을 모두 처리할 수 있음을 시연하는 것.
  • 고차원 상태 공간(픽셀 입력)과 다양한 데이터 예산에 대한 확장성을 보이는 것.

제안 방법

  • 저장된 데이터로부터 새로운 학습 타깃을 생성하기 위해 모델 기반의 정책 및 가치 개선 연산자를 사용한다.
  • Reanalyse를 MuZero의 MCTS 계획 및 학습된 세계 모델과 통합하여 p(정책), v(가치), r(보상)에 대해 업데이트된 타깃을 생성한다.
  • 학습된 모델을 K단계로 펼쳐서 재분석된 궤적에서 얻은 다단계 TD 타깃으로 학습한다.
  • 트리 탐색의 개선된 정책 pi_t와 가치 z_t로 학습 타깃을 조정하여 모델과 타깃의 상호 개선 사이클을 만든다.
  • Reanalyse fraction을 환경 상호작용에서 얻은 타깃과 재분석 데이터에서 얻은 타깃의 비율로 정의하여 데이터 예산을 제어한다.

실험 결과

연구 질문

  • RQ1특별한 off-policy 적응 없이도 단일 알고리즘이 온라인 RL과 오프라인 RL 설정에서 강한 성능을 동시에 달성할 수 있는가?
  • RQ2학습된 모델을 재사용하여 과거 데이터를 재분석하는 것이 서로 다른 데이터 예산에서 학습 효율에 어떤 영향을 미치는가?
  • RQ3Reanalyse를 MuZero와 결합하는 것이 시연으로부터의 학습과 순수 오프라인 데이터셋에서의 효과적인 학습을 가능하게 하는가?
  • RQ4픽셀 기반 및 연속 행위 작업에서 MuZero Unplugged의 성능이 특화된 오프라인 RL 기준선과 비교하여 어떤가?
  • RQ5통합 계획 기반 접근으로 어떤 데이터 예산 체계(온라인, 오프라인, 혼합)가 feasible한가?

주요 결과

  • Reanalyse는 저장된 데이터를 재사용하여 향상된 타깃으로 데이터 예산의 다양한 규모에서 데이터 효율적인 학습을 가능하게 한다.
  • MuZero Unplugged는 RL Unplugged(오프라인 Atari 및 연속 제어)와 온라인 Atari 벤치마크에서 특별한 오프라인 적응 없이 최첨단 결과를 달성한다.
  • Atari에서 MuZero Unplugged는 오프라인 데이터나 혼합 예산을 사용할 때 46개 게임 중 44개에서 베이스라인을 능가했다.
  • MuZero Unplugged는 또한 연속 제어 과제에서 DM Control Suite의 기준선과 일치하거나 이를 능가한다.
  • MCTS 기반 행동 선택과 Reanalyse 손실의 조합이 최고 성능을 낳아 MuZero Unplugged를 강력한 통합 RL 방법으로 확립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.