Skip to main content
QUICK REVIEW

[논문 리뷰] Skill-based Meta-Reinforcement Learning

Taewook Nam, Shao-Hua Sun|arXiv (Cornell University)|2022. 04. 25.
Domain Adaptation and Few-Shot Learning인용 수 11
한 줄 요약

이 논문은 장기적이고 보상이 희박한 작업에 대해 빠른 적응을 가능하게 하기 위해, 보상이나 작업 레이블이 없는 오프라인 데이터셋에서 재사용 가능한 스킬과 스킬 사전을 추출하는 스킬 기반 메타강화학습 방법인 SiMPL을 제안한다. 스킬 사전으로 정규화된 고수준 정책을 메타학습함으로써 SiMPL은 네비게이션 및 조작 작업에서 이전의 딥 강화학습, 메타강화학습, 다중작업 강화학습 방법들보다 수십만 배에 이르는 샘플 효율성 향상을 달성한다.

ABSTRACT

While deep reinforcement learning methods have shown impressive results in robot learning, their sample inefficiency makes the learning of complex, long-horizon behaviors with real robot systems infeasible. To mitigate this issue, meta-reinforcement learning methods aim to enable fast learning on novel tasks by learning how to learn. Yet, the application has been limited to short-horizon tasks with dense rewards. To enable learning long-horizon behaviors, recent works have explored leveraging prior experience in the form of offline datasets without reward or task annotations. While these approaches yield improved sample efficiency, millions of interactions with environments are still required to solve complex tasks. In this work, we devise a method that enables meta-learning on long-horizon, sparse-reward tasks, allowing us to solve unseen target tasks with orders of magnitude fewer environment interactions. Our core idea is to leverage prior experience extracted from offline datasets during meta-learning. Specifically, we propose to (1) extract reusable skills and a skill prior from offline datasets, (2) meta-train a high-level policy that learns to efficiently compose learned skills into long-horizon behaviors, and (3) rapidly adapt the meta-trained policy to solve an unseen target task. Experimental results on continuous control tasks in navigation and manipulation demonstrate that the proposed method can efficiently solve long-horizon novel target tasks by combining the strengths of meta-learning and the usage of offline datasets, while prior approaches in RL, meta-RL, and multi-task RL require substantially more environment interactions to solve the tasks.

연구 동기 및 목표

  • 장기적이고 보상이 희박한 작업에 대해 실세계 로봇 학습에서의 샘플 비효율성을 해결하기 위해.
  • 보상이 풍부하고 단기적인 작업에 국한된 기존 메타강화학습을 넘어서, 보상이나 작업 레이블이 없는 오프라인 데이터셋에서의 이전 경험을 통합함으로써 메타강화학습을 확장하기 위해.
  • 오프라인 데이터에서 재사용 가능한 스킬과 스킬 사전을 학습함으로써, 새로운 목표 작업에 빠르게 적응할 수 있도록 하기 위해.
  • 메타학습과 계층적 스킬 조합을 융합하여 장기적 제어 작업의 샘플 효율성을 향상시키기 위해.
  • 메타학습이 복잡하고 보상이 희박한 환경에서 효과적으로 작용할 수 있음을 보여주기 위해.

제안 방법

  • 보상이나 작업 레이블이 없는 트레이젝터리가 포함된 대규모 오프라인 데이터셋에서 재사용 가능한 스킬과 스킬 사전을 추출한다.
  • 스킬 사전을 정규화 항으로 사용하여 탐색을 이끌고, 고수준 정책을 메타학습하여 장기적 행동을 구성한다.
  • 고수준 정책이 저수준 스킬을 선택하고 순서를 정하는 계층적 강화학습 프레임워크를 사용한다.
  • 다양하거나 목표 작업과 유사한 메타학습 작업 분포를 고수준 정책 학습에 활용하여 일반화 능력을 향상시킨다.
  • 오프라인 데이터를 스킬 발견뿐만 아니라 메타학습 중 탐색을 줄이기 위한 사전 지식 확보 수단으로 활용한다.
  • 커리큘럼 학습과 작업 분포 편향 기법을 적용하여, 메타학습 작업의 분포 일치가 성능에 미치는 영향을 평가한다.

실험 결과

연구 질문

  • RQ1보상이나 작업 레이블이 없는 오프라인 데이터셋만을 사용하여 메타강화학습을 장기적이고 보상이 희박한 작업에 효과적으로 적용할 수 있는가?
  • RQ2메타학습 작업 분포의 질이 메타학습된 정책의 샘플 효율성에 어떤 영향을 미치는가?
  • RQ3스킬 기반 메타강화학습이 이전의 딥 강화학습 및 메타강화학습 방법들보다 환경 상호작용 횟수를 크게 줄일 수 있는가?
  • RQ4오프라인 데이터에서 학습한 스킬 사전이 메타학습 중 일반화 능력과 샘플 효율성을 향상시키는가?
  • RQ5메타학습 작업과 목표 작업의 분포가 일치할수록 성능 향상이 이루어지는가?

주요 결과

  • SiMPL은 이전 방법들보다 뚜렷한 샘플 효율성 향상을 달성하여, 새로운 장기적이고 보상이 희박한 작업을 수십만 배에 이르는 환경 상호작용 수로 해결한다.
  • 메타학습 작업이 10개 또는 20개뿐이어도 SiMPL은 최고의 베이스라인(SPiRL)을 능가하며, 희박한 메타학습 작업 분포에 대해서도 강건함을 입증한다.
  • 메타학습 작업 분포가 목표 작업과 일치할 경우(예: 미로의 상위 25%), SiMPL은 목표 작업에서 뛰어난 성능을 발휘한다.
  • 메타학습 작업과 목표 작업의 분포가 일치하지 않을 경우 성능이 저하되며, 이는 작업 분포 일치의 중요성을 확인한다.
  • SiMPL은 미로 내비게이션 및 주방 조작 작업 모두에서 SPiRL, MTRL 및 기타 베이스라인들을 능가하며, 특히 보상이 희박한 환경에서 뛰어난 성능을 보인다.
  • 오프라인 데이터에서 학습한 스킬 사전은 고수준 정책의 정규화에 효과적으로 기여하여, 메타테스트 기간 동안 효율적인 탐색과 더 빠른 적응을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.