Skip to main content
QUICK REVIEW

[논문 리뷰] Modulated Policy Hierarchies

Alexander Pashevich, Danijar Hafner|arXiv (Cornell University)|2018. 11. 30.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

모듈레이티드 포olic 히어라키 (MPH)는 사전 훈련이나 번갈아가며 훈련하는 단계 없이 희박한 보상에서 종단 간(end-to-end)으로 학습하는 계층적 강화학습 프레임워크를 도입한다. 스킬 혼합을 위한 비트벡터 모듈레이션과 모든 히어라키 수준에서의 내재적 동기부여를 통해 MPH는 로봇 조작 과제에서 기존의 옵션과 MLSH와 같은 베이스라인들을 능가하는 성능을 달성하였으며, FetchPush-v1에서 71%의 성공률과 최적의 랜덤 시드로 블록 스택킹 과제에서 99%의 성공률을 기록하였다.

ABSTRACT

Solving tasks with sparse rewards is a main challenge in reinforcement learning. While hierarchical controllers are an intuitive approach to this problem, current methods often require manual reward shaping, alternating training phases, or manually defined sub tasks. We introduce modulated policy hierarchies (MPH), that can learn end-to-end to solve tasks from sparse rewards. To achieve this, we study different modulation signals and exploration for hierarchical controllers. Specifically, we find that communicating via bit-vectors is more efficient than selecting one out of multiple skills, as it enables mixing between them. To facilitate exploration, MPH uses its different time scales for temporally extended intrinsic motivation at each level of the hierarchy. We evaluate MPH on the robotics tasks of pushing and sparse block stacking, where it outperforms recent baselines.

연구 동기 및 목표

  • 희박한 보상에서 수동적인 보상 형태 조정이나 사전 훈련 없이 로봇 조작 과제를 학습하는 데 도전하는 것.
  • 모든 정책 수준을 동시에 공동으로 훈련시켜 계층적 강화학습의 훈련 안정성을 향상시키는 것.
  • 히어라키의 각 수준에서 시간적으로 연장된 내재적 동기부여를 통해 계층적 에이전트의 탐색 능력을 향상시키는 것.
  • 스킬 선택을 위한 기존의 one-hot 또는 카테고리 신호 외의 대안적 모듈레이션 메커니즘을 탐색하는 것.
  • 다중 훈련 단계나 하이퍼파라미터에 의존하는 설계 없이 스케일러블하고 종단 간 훈련 가능한 계층적 강화학습 프레임워크를 개발하는 것.

제안 방법

  • MPH는 마스터 정책가 비트벡터 모듈레이션 신호를 생성하고, 워커 정책이 이러한 신호에 기반해 행동을 수행하는 이중 수준의 히어라키를 사용한다.
  • 비트벡터 모듈레이션은 스킬 간의 부드러운 보간을 가능하게 하여 단일 스킬 선택 외에 다수의 스킬을 동적으로 혼합할 수 있도록 한다.
  • 모든 정책 수준은 Proximal Policy Optimization (PPO)를 사용해 공동으로 훈련되며, 점진적인 정책 업데이트를 통해 안정적인 학습을 촉진한다.
  • 내재적 동기부여는 마스터 및 워커 수준 모두에 적용되며, 역학 모델의 예측 오차를 사용해 시간적으로 연장된 탐색을 장려한다.
  • 사전 훈련이나 별도의 훈련 단계를 피함으로써 희박한 보상에서 종단 간 학습이 가능해진다.
  • 마스터 정책가 워커보다 덜 자주 작동함으로써 다른 시간 스케일에서 작동함으로써 시간 추상화를 지원한다.

실험 결과

연구 질문

  • RQ1계층적 강화학습 에이전트는 사전 훈련이나 수동적 보상 형태 조정 없이 희박한 보상에서 학습할 수 있는가?
  • RQ2비트벡터 모듈레이션은 one-hot 또는 카테고리 신호 모듈레이션보다 계층적 정책 학습에서 더 우수한 성능을 내는가?
  • RQ3히어라키의 모든 수준에 내재적 동기부여를 적용하면 탐색 능력과 최종 성능이 향상되는가?
  • RQ4모든 정책 수준을 동시에 공동으로 훈련시키는 것이 번갈아가며 훈련하는 방법에 비해 안정적이고 효과적인가?
  • RQ5시간 추상화와 내재적 동기부여의 사용이 로봇 조작 과제에서 샘플 효율성과 성공률에 어떤 영향을 미치는가?

주요 결과

  • MPH는 FetchPush-v1 환경에서 71%의 성공률을 기록하여 다음으로 우수한 베이스라인(MLSH)보다 26%포인트 높은 성능을 보였다.
  • 희박한 블록 스택킹 과제에서 MPH는 최적의 랜덤 시드로 99%의 성공률을 달성하여 다른 방법들보다 뚜렷이 뛰어난 성능을 보였다.
  • 절단 실험 결과, 마스터 및 워커 정책 양쪽에 내재적 동기부여를 적용한 경우가 가장 높은 성능을 보였으며, 스택킹 과제에서 20%포인트, 밀고 치기 과제에서 14%포인트 성공률 향상을 보였다.
  • 비트벡터 모듈레이션은 one-hot 모듈레이션보다 더 나은 스킬 혼합을 가능하게 하여 성능 향상과 더 유연한 정책 행동을 이끌었다.
  • PPO를 사용해 모든 정책 수준을 공동으로 훈련함으로써 다중 훈련 단계나 사전 훈련이 필요 없어졌고, 이는 구현을 단순화하고 안정성을 향상시켰다.
  • MPH의 마스터 정책는 시간 스케일 4를 사용하였으며, 옵션 프레임워크와 유사한 간격으로 모듈레이션 신호가 변경되었지만, 다중 비트 모듈레이션 덕분에 더 높은 스킬 용량을 가졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.