Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Black-Box Reinforcement Learning with Movement Primitives

Fabian Otto, Onur Çelik|arXiv (Cornell University)|2022. 10. 18.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 이동 원리에 대한 정밀하고 고차원적인 정책 갱신을 가능하게 하기 위해 미분 가능한 신뢰 영역 투영층(TRPL)을 사용하는 딥 에피소드 기반 강화학습(ERL) 알고리즘을 제안한다. 이는 희박하고 비마르코프 보상 환경에서 단계 기반 방법보다 뛰어난 성능을 보이며, 더 높은 품질, 더 부드럽고 에너지 효율적인 정책을 도출한다. 특히 점프, 공 던지기, 탁구와 같은 복잡한 로봇 제어 작업에서 두각을 나타낸다.

ABSTRACT

\Episode-based reinforcement learning (ERL) algorithms treat reinforcement learning (RL) as a black-box optimization problem where we learn to select a parameter vector of a controller, often represented as a movement primitive, for a given task descriptor called a context. ERL offers several distinct benefits in comparison to step-based RL. It generates smooth control trajectories, can handle non-Markovian reward definitions, and the resulting exploration in parameter space is well suited for solving sparse reward settings. Yet, the high dimensionality of the movement primitive parameters has so far hampered the effective use of deep RL methods. In this paper, we present a new algorithm for deep ERL. It is based on differentiable trust region layers, a successful on-policy deep RL algorithm. These layers allow us to specify trust regions for the policy update that are solved exactly for each state using convex optimization, which enables policies learning with the high precision required for the ERL. We compare our ERL algorithm to state-of-the-art step-based algorithms in many complex simulated robotic control tasks. In doing so, we investigate different reward formulations - dense, sparse, and non-Markovian. While step-based algorithms perform well only on dense rewards, ERL performs favorably on sparse and non-Markovian rewards. Moreover, our results show that the sparse and the non-Markovian rewards are also often better suited to define the desired behavior, allowing us to obtain considerably higher quality policies compared to step-based RL.

연구 동기 및 목표

  • 에피소드 기반 RL에서 고차원 이동 원리 매개변수에 딥 RL을 적용하는 데 도전하는 것.
  • 단계 기반 RL이 일반적으로 실패하는 희박하고 비마르코프 보상 환경에서 효과적인 학습을 가능하게 하는 것.
  • 고차원 매개변수 공간에 적합한 안정적이고 정밀한 정책 갱신 메커니즘을 개발하는 것.
  • 희박하고 비마르코프 보상이 공학적으로 설계된 밀도 높은 보상보다 더 높은 품질의 정책을 이끌 수 있음을 보여주는 것.

제안 방법

  • 정책 갱신 중 정확한 신뢰 영역을 유지하기 위해 미분 가능한 신뢰 영역 투영층(TRPL)을 사용하여 고차원 행동 공간에서의 높은 정밀도를 확보한다.
  • 맥락 인식 정책이 이동 원리 매개변수를 예측하는 데 사용되는 블랙박스 RL 프레임워크를 적용한다.
  • 부드럽고 궤적 기반의 제어 정책을 생성하기 위해 이동 원리(MPs)를 활용한다.
  • 각 시간 단계에서 목표 상태를 저수준 동작으로 매핑하는 궤적 추적 제어기를 통합한다.
  • 컨트롤러 매개변수 공간에서의 최적화 문제로 이동 원리 매개변수 예측을 간주한다.
  • TRPL을 통한 볼록 최적화를 활용하여 신뢰 영역을 정확히 해결함으로써 PPO 유사 방법에서 흔한 근사 오류를 피한다.

실험 결과

연구 질문

  • RQ1미분 가능한 신뢰 영역을 갖춘 딥 ERL은 희박하고 비마르코프 보상 환경에서 단계 기반 RL을 능가할 수 있는가?
  • RQ2비마르코프 및 희박 보상은 밀도 높은 마르코프 보상보다 더 높은 품질의 정책과 더 에너지 효율적인 정책을 이끌 수 있는가?
  • RQ3TRPL은 고차원 이동 원리 매개변수 공간에서 안정적이고 정밀한 정책 갱신을 가능하게 할 수 있는가?
  • RQ4제안된 방법은 밀도 높은 보상으로 쉽게 표현할 수 없는 복잡한 실제 작업 사양에 대해 강건한가?

주요 결과

  • 점프 테스크에서 BBRL-TRPL는 중심 질량 높이를 약 20cm까지 도달시켰으며, PPO보다 20% 높았고, 목표 정밀도가 향상되었다.
  • 비어 퐁 테스크에서 BBRL-TRPL는 동적 리커스팅 타이밍으로 공을 컵에 넣는 데 성공했으며, 고정된 최적 리커스팅 타이밍 조건에서도 PPO는 실패했다.
  • 탁구 테스크에서 BBRL-TRPL는 60% 이상의 경우에 공을 목표 지점 근처로 되돌려보냈고, PPO 및 BBRL-PPO는 충분한 정밀도를 확보하지 못했다.
  • 비마르코프 환경에서 BBRL-TRPL는 PPO 및 TRPL보다 일관되게 뛰어난 성능을 보이며, 복잡하고 시간에 민감한 행동에 강건함을 입증했다.
  • 희박하고 비마르코프 보상은 공학적으로 설계된 밀도 높은 보상보다 더 에너지 효율적이고 강건한 정책을 이끌어냈다.
  • CMORE는 공을 안정적으로 던지긴 했지만 일부 맥락에 대해서만 가능했고, BBRL-TRPL는 전체 맥락 공간에서 일반화 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.