Skip to main content
QUICK REVIEW

[논문 리뷰] Guided Meta-Policy Search

Russell Mendonca, Abhishek Gupta|arXiv (Cornell University)|2019. 04. 01.
Reinforcement Learning in Robotics참고 문헌 46인용 수 16
한 줄 요약

이 논문은 가이드드 메타정책 서치(GMPS)를 제안한다. GMPS는 메타학습 동안 샘플 효율성을 높이기 위해 오프-폴리시 강화학습 또는 인간의 시범을 전문가 지도로 사용하여 빠른 강화학습 절차를 학습함으로써 메타-강화학습 메서드이다. GMPS는 이전의 메타-강화학습 방법들보다 최대 10배 높은 샘플 효율성을 달성하며, 희박한 보상 환경과 시각적 제어 작업에서 효과적인 적응을 가능하게 한다.

ABSTRACT

Reinforcement learning (RL) algorithms have demonstrated promising results on complex tasks, yet often require impractical numbers of samples since they learn from scratch. Meta-RL aims to address this challenge by leveraging experience from previous tasks so as to more quickly solve new tasks. However, in practice, these algorithms generally also require large amounts of on-policy experience during the meta-training process, making them impractical for use in many problems. To this end, we propose to learn a reinforcement learning procedure in a federated way, where individual off-policy learners can solve the individual meta-training tasks, and then consolidate these solutions into a single meta-learner. Since the central meta-learner learns by imitating the solutions to the individual tasks, it can accommodate either the standard meta-RL problem setting or a hybrid setting where some or all tasks are provided with example demonstrations. The former results in an approach that can leverage policies learned for previous tasks without significant amounts of on-policy data during meta-training, whereas the latter is particularly useful in cases where demonstrations are easy for a person to provide. Across a number of continuous control meta-RL problems, we demonstrate significant improvements in meta-RL sample efficiency in comparison to prior work as well as the ability to scale to domains with visual observations.

연구 동기 및 목표

  • 메타학습 동안 메타-강화학습의 높은 샘플 복잡도 문제를 해결함으로써 실세계 환경에서의 실용성을 제고하기 위해.
  • 안정적인 이민 학습을 지도로 사용하여 전문가 경로 생성을 메타정책 학습에서 분리함으로써 효율적인 메타최적화를 가능하게 하기 위해.
  • 메타최적화 중 탐색을 안내하기 위해 시범을 통합하여 희박한 보상 환경에서 샘플 효율성을 향상시키기 위해.
  • 안정적인 이민 기반 메타최적화를 사용하여 고차원의 시각적 관측 공간으로 메타-강화학습을 확장하기 위해.
  • 메타테스트 시기 동안 몇 번의 기울기 하강 단계만으로도 시각 기반 정책의 빠른 적응을 가능하게 하기 위해.

제안 방법

  • GMPS는 각 메타학습 작업에 대해 오프-폴리시 강화학습 또는 인간의 시범을 통해 생성된 전문가 정책을 모방하여 메타학습자를 훈련시킨다.
  • 메타학습자는 내부 루프에서 한 번 또는 몇 번의 기울기 하강 단계 후 전문가 행동을 따라하기 위해 감독 이민 손실을 사용하여 최적화된다.
  • 전문가 정책은 효율적인 오프-폴리시 강화학습 알고리즘을 사용하여 독립적으로 생성되며, 메타학습 기간 동안 온-폴리시 데이터 수집을 피한다.
  • 시각 제어 작업의 경우 전체 정책(합성곱 및 완전히 연결된 레이어 포함)이 메타최적화되지만, 내부 루프의 피팅 조정 시에는 오직 완전히 연결된 레이어만 적응된다.
  • 가용한 경우 시범을 사용하는 하이브리드 설정을 지원하여 안정성과 샘플 효율성을 향상시킨다.
  • 이 방법은 전문가 정책 생성과 메타최적화를 분리함으로써 확장 가능하고 안정적인 메타-강화학습 훈련을 가능하게 한다.

실험 결과

연구 질문

  • RQ1감독 기반 이민 학습이 메타학습 기간 동안 메타-강화학습의 샘플 복잡도를 크게 줄이는 데 사용될 수 있는가?
  • RQ2전문가 시범을 통합할 경우 희박한 보상 환경에서 메타최적화의 안정성과 샘플 효율성에 어떤 영향을 미치는가?
  • RQ3GMPS는 메타테스트 시기 동안 몇 번의 기울기 하강 단계만으로도 시각 기반 정책의 빠른 적응을 가능하게 하는가?
  • RQ4GMPS는 MAML, PEARL, MAESN과 같은 표준 메타-강화학습 방법들에 비해 샘플 효율성과 성능 측면에서 어떻게 비교되는가?
  • RQ5다중 작업 이민으로 미리 훈련한 후 GMPS가 분포 외부 작업으로 효과적으로 전이 가능한가?

주요 결과

  • GMPS는 PEARL, MAESN, MAML과 같은 이전의 메타-강화학습 방법들보다 메타학습에서 최대 10배 높은 샘플 효율성을 달성한다.
  • 문을 열기나 다리가 있는 운동과 같은 희박한 보상 환경에서, 표준 메타-강화학습은 보상 신호가 부족하여 실패하는 반면, GMPS는 탐색 전략을 성공적으로 학습한다.
  • 시각 기반 작업에서는 GMPS가 합성곱 정책의 안정적인 훈련을 가능하게 하며, 최종 성능과 샘플 효율성 측면에서 MAML과 단일 작업 강화학습보다 뛰어나다.
  • 검증용 분리된 작업에서 GMPS는 다중 작업 이민 피팅보다 뚜렷이 뛰어난 적응 능력을 보이며, 뛰어난 적응 능력을 입증한다.
  • 고차원의 시각적 관측 공간에서도 GMPS는 몇 번의 기울기 하강 단계만으로도 정책의 빠른 적응을 가능하게 한다.
  • 메타학습 기간 동안 시범을 사용함으로써 탐색 과제를 줄이고, 희박한 보상 설정에서 효과적인 메타최적화를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.