Skip to main content
QUICK REVIEW

[논문 리뷰] Sub-policy Adaptation for Hierarchical Reinforcement Learning

Alexander C. Li, Carlos Florensa|arXiv (Cornell University)|2019. 06. 13.
Reinforcement Learning in Robotics참고 문헌 43인용 수 13
한 줄 요약

이 논문은 계층 강화 학습에서 관리자와 하위 정책을 함께 훈련함으로써 새로운 작업 훈련 중 기술의 연속적인 적응을 가능하게 하는 새로운 온정책 알고리즘인 계층적 프록시멀 정책 최적화(HiPPO)를 제안한다. 비편향된 잠재의존 기반과 분리된 정책 기울기의 활용을 통해 HiPPO는 제로샷 전이 및 피취닝 시나리오에서 더 빠른 수렴과 뛰어난 성능을 달성하며, 사전 훈련된 기술을 고정하는 기존 방법들을 능가한다.

ABSTRACT

Hierarchical reinforcement learning is a promising approach to tackle long-horizon decision-making problems with sparse rewards. Unfortunately, most methods still decouple the lower-level skill acquisition process and the training of a higher level that controls the skills in a new task. Leaving the skills fixed can lead to significant sub-optimality in the transfer setting. In this work, we propose a novel algorithm to discover a set of skills, and continuously adapt them along with the higher level even when training on a new task. Our main contributions are two-fold. First, we derive a new hierarchical policy gradient with an unbiased latent-dependent baseline, and we introduce Hierarchical Proximal Policy Optimization (HiPPO), an on-policy method to efficiently train all levels of the hierarchy jointly. Second, we propose a method for training time-abstractions that improves the robustness of the obtained skills to environment changes. Code and results are available at sites.google.com/view/hippo-rl

연구 동기 및 목표

  • 새로운 작업으로 전이할 때 고정된 하위 정책의 부적절성 문제를 해결하기 위해.
  • 적응 과정에서 관리자와 하위 정책을 함께 최적화하는 통합 훈련 프레임워크를 개발하기 위해.
  • 장수평, 희소 보상 환경에서의 샘플 효율성과 수렴 속도를 향상시키기 위해.
  • 하위 정책의 시간 할당(주기)을 무작위화하는 것이 정확도와 전이 성능에 미치는 영향을 경험적으로 검증하기 위해.
  • 계층 정책 기울기의 비편향적이고 잠재의존적인 기반을 이론적으로 정당화하고 구현하기 위해.

제안 방법

  • 비편향된 잠재의존 기반을 갖춘 계층 정책 기울기의 유도로, 관리자와 하위 정책에 대해 분리된 효율적인 기울기 계산을 가능하게 한다.
  • 신뢰구역 최적화(프록시멀 정책 최적화)를 사용하는 안정적인 온정책 알고리즘인 HiPPO를 도입하여 계층 수준 간의 상호의존성을 다룬다.
  • 분리된 통찰: 하위 정책의 관점에서 관리자의 잠재 행동은 관측의 일부로 간주되며, 이는 기울기 계산을 단순화한다.
  • 훈련 중 하위 정책의 시간 할당(주기 p)을 무작위화하여 정확도와 일반화 능력을 향상시킨다.
  • 관리자의 잠재 코드에 조건부로 행동을 수행하는 저수준 정책을 사용하며, 관리자는 낮은 빈도로 작동한다.
  • 하위 정책의 다양성 가정 하에 정책 기울기의 수치적 근사를 적용하였으며, 경험적으로 검증하였다.

실험 결과

연구 질문

  • RQ1사전 훈련된 기술을 고정하는 것과 비교해 관리자와 하위 정책의 공동 훈련이 새로운 작업에서 성능 향상에 기여하는가?
  • RQ2제안된 잠재의존 기반은 계층 강화 학습에서 기울기 분산을 줄이고 수렴 속도를 가속화하는가?
  • RQ3하위 정책의 시간 할당을 무작위화하면 계층 강화 학습에서 성능과 제로샷 전이에 어떤 영향을 미치는가?
  • RQ4작업 선호도(예: 속도 대 안정성)가 사전 훈련 목표와 다를 때 HiPPO는 사전 훈련된 기술을 효과적으로 피취닝할 수 있는가?
  • RQ5제안된 계층 정책 기울기 근사는 현실 조건 하에서 정확한 기울기와 수치적으로 안정적이고 유사한가?

주요 결과

  • HiPPO는 Ant Gather에서 환경 변화를 무작위화한 상황에서 제로샷 전이 시 PPO 및 고정 기술 기반 모델보다 37% 높은 수익을 기록하며 슈퍼리어한 성능을 보였다.
  • Block Hopper에서 HiPPO는 주기 무작위화를 통해 고정 주기 기반 모델 대비 최종 수익을 37% 향상시켜 환경 변화에 대한 강건성을 입증했다.
  • CoM 속도 페널티가 있는 Gather 작업에서 사전 훈련된 기술을 피취닝할 때 HiPPO는 Option-Critic, MLSH, HIRO보다 더 높은 최종 성능을 달성하여 뛰어난 적응 능력을 보였다.
  • Snake Gather에서 근사 기울기와 정확한 기울기 간余kosine 유사도는 0.98±0.01이었으며, 다양성 가정 하에서 기울기 근사의 타당성을 확인했다.
  • 기타 하위 정책의 평균 최대 행동 확률은 0.09–0.13이었으며, 기울기 근사에서 무시된 항목이 무시할 만큼 작다는 가정(ε^p ≈ 10^-10)을 뒷받침했다.
  • HiPPO는 Ant와 Snake와 같은 희소 보상, 장수평 작업에서 비계층적 PPO보다 더 빠른 수렴과 뛰어난 최종 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.