Skip to main content
QUICK REVIEW

[논문 리뷰] Offline Meta Reinforcement Learning.

Ron Dorfman, Aviv Tamar|arXiv (Cornell University)|2020. 08. 06.
Reinforcement Learning in Robotics인용 수 7
한 줄 요약

이 논문은 N개의 사전 훈련된 강화학습(Reinforcement Learning, RL) 에이전트로부터 수집한 오프라인 데이터를 활용하여, 새로운 미리보지 않은 태스크에 빠르게 적응할 수 있는 베이즈 최적 정책을 학습하는 오프라인 메타강화학습(Offline Meta Reinforcement Learning, OMRL)을 제안한다. 딥 네URAL 네트워크를 사용하여 VariBAD를 오프정책 설정으로 확장함으로써, 샘플 효율적인 메타-RL 학습을 달성하였으며, 이는 온라인 메타-RL 설정에서 기존 방법들을 크게 능가한다.

ABSTRACT

Consider the following problem, which we term Offline Meta Reinforcement Learning (OMRL): given the complete training histories of $N$ conventional RL agents, trained on $N$ different tasks, design a learning agent that can quickly maximize reward in a new, unseen task from the same task distribution. In particular, while each conventional RL agent explored and exploited its own different task, the OMRL agent must identify regularities in the data that lead to effective exploration/exploitation in the unseen task. To solve OMRL, we take a Bayesian RL (BRL) view, and seek to learn a Bayes-optimal policy from the offline data. We extend the recently proposed VariBAD BRL algorithm to the off-policy setting, and demonstrate learning of Bayes-optimal exploration strategies from offline data using deep neural networks. Furthermore, when applied to the online meta-RL setting (agent simultaneously collects data and improves its meta-RL policy), our method is significantly more sample efficient than the conventional VariBAD.

연구 동기 및 목표

  • 기존에 훈련된 RL 에이전트들로부터의 오프라인 데이터만을 사용하여 새로운, 미리보지 않은 태스크에 빠르게 적응하는 문제에 대응하기 위해.
  • 온라인 상호작용 없이도 다양한 태스크 간의 공통적인 규칙성을 식별할 수 있는 메타-RL 에이전트를 개발하기 위해.
  • 딥 네URAL 네트워크를 사용하여 베이지안 강화학습(Bayesian RL, BRL)을 오프라인, 오프정책 설정으로 확장하기 위해.
  • 메타정책 사전 훈련을 위해 오프라인 데이터를 활용하여 온라인 메타-RL의 샘플 효율성을 향상시키기 위해.

제안 방법

  • N개의 다른 태스크에서 수집된 오프라인 데이터로부터 베이즈 최적 정책을 학습하기 위해 베이지안 강화학습(Bayesian RL, BRL)의 시각을 채택한다.
  • 오프라인 설정에서 효과적으로 작동할 수 있도록 VariBAD 알고리즘을 오프정책 설정으로 확장한다.
  • 딥 네URAL 네트워크를 사용하여 정책과 가치 함수의 사후분포를 표현함으로써 고차원 상태-행동 공간에서의 스케일러블 추론을 가능하게 한다.
  • 다양한 태스크 간의 공통적인 탐색 및 이용 전략을 포착하기 위해 오프라인 시범 데이터를 사용하여 메타정책을 훈련시킨다.
  • 오프라인 데이터의 구조를 활용하여, 새로운 태스크에 대한 신속한 적응을 지원하는 일반화 가능한 인도적 편향을 추론한다.
  • 적응 과정에서 추가적인 환경 상호작용이 필요 없이, 결과적으로 도출된 메타정책을 새로운 태스크에 적용한다.

실험 결과

연구 질문

  • RQ1메타-RL 에이전트는 기존에 훈련된 에이전트들로부터의 오프라인 데이터만을 사용하여 태스크 간 일반화를 학습할 수 있는가?
  • RQ2메타-RL 설정에서 정적이고 오프정책인 데이터셋으로부터 베이즈 최적 정책을 얼마나 잘 근사할 수 있는가?
  • RQ3기존의 표준 방법과 비교하여, 오프라인 데이터로 사전 훈련하면 온라인 메타-RL에서 샘플 효율성이 향상되는가?
  • RQ4오프라인 데이터로부터 어떤 인도적 편향을 발견하여, 새로운 태스크에서 효과적인 탐색을 지원할 수 있는가?
  • RQ5샘플 효율성 측면에서, 제안된 방법은 온라인 메타-RL 기준선과 비교하여 어떻게 성능을 내는가?

주요 결과

  • 제안된 OMRL 방법은 딥 네URAL 네트워크를 사용하여 오프라인 데이터로부터 베이즈 최적의 탐색 전략을 성공적으로 학습한다.
  • 이 방법은 온라인 메타-RL에서 높은 샘플 효율성을 달성하여, 온라인 설정에서 적용되었을 때 기존의 VariBAD를 크게 능가한다.
  • 오프라인 데이터를 활용함으로써, 추론 과정에서 추가적인 환경 상호작용이 없더라도 새로운, 미리보지 않은 태스크에 효과적으로 일반화된다.
  • VariBAD를 오프정책 설정으로 확장함으로써 정적 데이터셋으로부터 안정적이고 효과적인 학습이 가능해졌다.
  • 이 방법은 학습 중에 볼 수 없었던 새로운 태스크에 대해서도 신속한 적응을 지원하는 태스크 간의 공통적인 규칙성을 식별한다.
  • 이 방법은 여러 RL 에이전트로부터의 오프라인 데이터를 효과적으로 융합하여 단일 메타정책으로 만들 수 있음을 보여주며, 이는 신속하고 일반화 가능한 학습을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.