Skip to main content
QUICK REVIEW

[논문 리뷰] MBRL-Lib: A Modular Library for Model-based Reinforcement Learning

Luis A. Pineda, Brandon Amos|arXiv (Cornell University)|2021. 04. 20.
Reinforcement Learning in Robotics참고 문헌 37인용 수 15
한 줄 요약

MBRL-Lib는 연속 제어를 위한 모델 기반 강화학습(MBRL) 연구 및 구현을 가속화하기 위해 설계된, PyTorch 기반의 오픈소스 라이브러리입니다. 동적 모델링, 계획, 정책 최적화를 위한 모듈식이고 재사용 가능한 컴포onent을 제공하며, MBPO 및 PETS와 같은 최신 알고리즘의 재현 가능한 구현을 포함하여 Mujoco 환경 간 일관된 성능을 보장하는 빠른 프로토타이핑, 디버깅 및 벤치마킹을 가능하게 합니다.

ABSTRACT

Model-based reinforcement learning is a compelling framework for data-efficient learning of agents that interact with the world. This family of algorithms has many subcomponents that need to be carefully selected and tuned. As a result the entry-bar for researchers to approach the field and to deploy it in real-world tasks can be daunting. In this paper, we present MBRL-Lib -- a machine learning library for model-based reinforcement learning in continuous state-action spaces based on PyTorch. MBRL-Lib is designed as a platform for both researchers, to easily develop, debug and compare new algorithms, and non-expert user, to lower the entry-bar of deploying state-of-the-art algorithms. MBRL-Lib is open-source at https://github.com/facebookresearch/mbrl-lib.

연구 동기 및 목표

  • 모델 기반 강화학습 분야의 연구자와 실무자들이 접근하기 쉬운 모듈식이고 재사용 가능한 소프트웨어 프레임워크를 제공함으로써 진입 장벽을 낮추기 위해.
  • 다이내믹스 모델과 제어 목표 간의 복잡한 상호작용으로 인해 발생하는 재현 가능성과 디버깅 과제를 해결하기 위해.
  • 최신 MBRL 알고리즘(MBPO, PETS 등)의 즉시 사용이 가능한 고정밀도 구현을 제공하여 쉽게 수정하고 확장할 수 있도록 하기 위해.
  • 공동체 기반 개발을 촉진하기 위해 연구자들이 공통된 표준 코드베이스를 기반으로 새로운 알고리즘을 구축하고 테스트하며 기여할 수 있도록 하기 위해.
  • 모델 자유형과 모델 기반 강화학습 간의 성능 격차를 줄이기 위해, MBRL 연구에 접근 가능하고 잘 설계된 도구를 제공하기 위해.

제안 방법

  • 동적 계산 그래프와 현대 딥러닝 워크플로우와의 간편한 통합을 지원하기 위해 PyTorch 기반으로 라이브러리를 구축했습니다.
  • 핵심 MBRL 컴포넌트인 다이내믹스 모델, 플래너, 보상 함수, 정책 최적화기의 모듈식 추상화를 제공하여 즉시 교환 가능한 실험을 가능하게 합니다.
  • 정확도 향상을 위해 몬테카를로 롤아웃과 함께 상위-k '엘리트' 모델을 사용하는 확률적 앙상블 모델을 사용한 다이내믹스 예측을 수행합니다.
  • 모델 기반 계획(예: PETS의 CEM)과 모델 기반 오프-폴리시 RL 에이전트(예: MBPO의 SAC)의 정밀 조정을 시뮬레이션된 트레이젝터리 기반으로 지원합니다.
  • 손실 추적, 트레이젝터리 플로팅, 표준화된 벤치마킹을 위한 평가 파이프라인을 포함한 내장된 시각화 및 디버깅 도구를 제공합니다.
  • 모든 구현은 정규화된 관측값을 사용하며, 전체 데이터셋에 대해 매 250개 환경 스텝마다 다이내믹스 모델을 재학습하고, MBPO의 경우 검증 분할을 사용합니다.

실험 결과

연구 질문

  • RQ1모듈식이고 오픈소스인 라이브러리가 모델 기반 강화학습 연구의 복잡성 저감과 재현 가능성 향상에 어떻게 기여할 수 있는가?
  • RQ2MBPO 및 PETS와 같은 표준화된 PyTorch 기반 MBRL 알고리즘의 구현이 원본 구현의 성능을 어느 정도 재현할 수 있는가?
  • RQ3아키텍처 선택(예: 결정론적 vs. 확률적 앙상블)이 MBRL에서 학습 안정성과 샘플 효율성에 어떤 영향을 미치는가?
  • RQ4통합 소프트웨어 플랫폼이 다양한 환경 간 신규 MBRL 알고리즘의 개발 및 비교를 얼마나 빠르게 가속화할 수 있는가?
  • RQ5초기화 조정 및 데이터 전처리(예: 정규화, 입력 변환)가 MBRL 결과의 재현 가능성에 어떤 영향을 미치는가?

주요 결과

  • MBRL-Lib에서 구현한 MBPO는 Mujoco 2.0 환경 5개에서 원본 구현과 유사한 성능를 보였으며, Ant 환경에서는 더 높은 수익을 기록했습니다.
  • HalfCheetah 환경에서 MBRL-Lib의 MBPO는 원본 구현보다 성능이 열 劣하므로, 초모수나 실행 세부 사항에 차이가 있을 가능성이 있습니다.
  • MBRL-Lib의 PETS는 CartPole와 InvertedPendulum 환경에서 일관된 성능를 보였지만, InvertedPendulum에서는 MBPO에 비해 더 높은 불안정성을 보였습니다.
  • CartPole 환경에서는 결정론적 앙상블이 PETS의 학습 속도를 향상시켰고, 다른 환경에서는 확률적 앙상블이 더 우수한 성능를 보였습니다.
  • MBRL-Lib에서의 PETS는 원본 성능을 재현하지 못했으며, 이는 원본 코드베이스에서 입력 전처리 및 보상 함수 설계의 차이로 인한 것으로 보입니다.
  • 라이브러리는 문헌에서의 핵심 결과를 성공적으로 재현하여 표준화되고 확장 가능한 프레임워크에서 알고리즘 개발 및 벤치마킹에 실용성을 입증했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.