Skip to main content
QUICK REVIEW

[논문 리뷰] PC-MLP: Model-based Reinforcement Learning with Policy Cover Guided Exploration

Yuda Song, W. Sun|arXiv (Cornell University)|2021. 07. 15.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

PC-MLP는 정책 커버와 계획 오라클 효율적인 접근 방식을 사용하여 비선형 동역학 시스템에서 효율적이고 증명 가능하게 샘플 효율적인 탐색을 가능하게 하는 모델 기반 강화학습 알고리즘입니다. 이 알고리즘은 HandEgg 및 AntMaze와 같은 도전적인 환경을 포함한 희박 보상 및 조밀 보상 제어 작업에서 최신 기술 수준의 성능을 달성하면서도 계산 효율성을 유지하고 보상 없이도 탐색을 가능하게 합니다.

ABSTRACT

Model-based Reinforcement Learning (RL) is a popular learning paradigm due to its potential sample efficiency compared to model-free RL. However, existing empirical model-based RL approaches lack the ability to explore. This work studies a computationally and statistically efficient model-based algorithm for both Kernelized Nonlinear Regulators (KNR) and linear Markov Decision Processes (MDPs). For both models, our algorithm guarantees polynomial sample complexity and only uses access to a planning oracle. Experimentally, we first demonstrate the flexibility and efficacy of our algorithm on a set of exploration challenging control tasks where existing empirical model-based RL approaches completely fail. We then show that our approach retains excellent performance even in common dense reward control benchmarks that do not require heavy exploration. Finally, we demonstrate that our method can also perform reward-free exploration efficiently. Our code can be found at https://github.com/yudasong/PCMLP.

연구 동기 및 목표

  • 실험적 모델 기반 강화학습에서 전략적 탐색의 부족으로 인해 희박 보상 또는 복잡한 동역학 환경에서 성능이 떨어지는 문제를 해결하기 위해.
  • 커널 기반 비선형 조절자(KNRs)와 선형 MDP에 대해 증명 가능하게 샘플 효율적이고 계산 효율적인 알고리즘을 개발하기 위해.
  • 낙관적 계획 오라클에 의존하지 않고도 효율적인 탐색을 가능하게 하여 표준 계획 도구와의 통합을 가능하게 하기 위해.
  • 다양한 제어 벤치마크에서 강력한 성능을 보여주며, 탐색에 어려움을 겪는 환경과 조밀 보상 환경을 포함한 다양한 환경에서의 성능을 입증하기 위해.
  • 정책 커버 커버리지 맵을 활용하여 보상 없이도 탐색을 지원하기 위해.

제안 방법

  • 알고리즘은 모델 피팅 중 치명적인 기억 상실을 방지하기 위해 이전에 학습된 정책들의 앙상블인 정책 커버를 유지합니다.
  • 정책 커버에 속한 정책들이 수집한 트레이젝터리에서 동역학 모델을 피팅하는 모델 학습 구성요소를 사용합니다.
  • 선형 밴딧 알고리즘(Dani 등, 2008)에서 영감을 얻은 보상 보너스 기법을 사용하여 연속적인 상태 및 행동 공간에서의 탐색을 장려합니다.
  • 계산적으로 비용이 많이 드는 낙관적 계획 오라클을 사용하지 않고, 표준 계획 오라클에만 의존합니다.
  • 실용적인 딥 러닝 변형인 Deep PC-MLP는 동역학 모델링에 딥 네ural 네트워크를 사용하고, 보상 보너스에는 랜덤 특징(RFF 등)을 사용합니다.
  • TRPO와 MPPI와 같은 표준 계획 도구를 통합하여 실제 제어 작업에 대한 융통성 있는 구현을 가능하게 합니다.

실험 결과

연구 질문

  • RQ1RKHS 기반으로 모델링된 비선형 시스템(KNRs)에서 모델 기반 강화학습 알고리즘이 증명 가능하게 샘플 효율적이고 계산 효율적인가요?
  • RQ2정책 커버와 표준 계획 오라클을 사용하면 이전 방법이 실패하는 희박 보상 환경에서 효과적인 탐색이 가능한가요?
  • RQ3특수한 탐색 메커니즘이 필요 없이도 조밀 보상 벤치마크에서 강력한 성능을 유지할 수 있나요?
  • RQ4PC-MLP는 복잡한 환경에서 얼마나 효율적으로 보상 없이 탐색을 수행할 수 있나요?
  • RQ5기존 기준 대비 벽시계 시간과 샘플 효율성 측면에서 알고리즘이 어떻게 스케일링되는가요?

주요 결과

  • PC-MLP는 다항식 샘플 복잡도를 달성하고 계획 오라클 효율적이며, 표준 오프더쉐프 계획 도구와의 사용이 가능합니다.
  • HandEgg 환경에서, PC-MLP는 랜덤 탐색에 의존하는 SLBO 및 MBPO보다 훨씬 더 빠르게 학습을 진행하며, 성과를 내는 데 성공합니다.
  • AntMaze 환경에서, PC-MLP는 보상 신호 없이도 다섯 개의 정책으로 이루어진 정책 커버만으로 미로를 성공적으로 탐색하여 효과적인 커버리지를 입증합니다.
  • 실용적인 Deep PC-MLP 구현은 PETS-GT 및 MBPO와 유사한 벽시계 시간을 기록하며, 탐색 보너스 계산으로 인한 오버헤드는 미미합니다.
  • MountainCar 및 Acrobot과 같은 조밀 보상 벤치마크에서, PC-MLP는 TRPO와 MPPI를 모두 사용하여 뛰어난 성능을 달성합니다.
  • 장수명 태스크에서 알고리즘은 안정적인 성능을 유지하며, 정책 업데이트에서의 진동 감소로 인해 TRPO가 MPPI보다 우수한 성능을 보입니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.