Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Policy Search via Return-Weighted Density Estimation

Takayuki Osa, Masashi Sugiyama|arXiv (Cornell University)|2017. 11. 28.
Reinforcement Learning in Robotics인용 수 8
한 줄 요약

이 논문은 궤도의 수익 가중 밀도 추정을 통한 계층적 정책 탐색(HPSDE)을 제안한다. 이는 모델-프리 방법으로, 수익 가중 밀도를 추정함으로써 옵션 정책의 수와 위치를 자동으로 발견한다. 이는 수동적인 초모수 조정 없이도 수익 함수의 모드에 대응하는 다수의 구분되는 잡기/자세 정책을 학습함으로써 계층 강화 학습 분야에서 최신 기술을 능가한다. 특히 다중 자유도 로봇 암을 위한 복잡한 운동 계획에서 뛰어난 성능을 보인다.

ABSTRACT

Learning an optimal policy from a multi-modal reward function is a challenging problem in reinforcement learning (RL). Hierarchical RL (HRL) tackles this problem by learning a hierarchical policy, where multiple option policies are in charge of different strategies corresponding to modes of a reward function and a gating policy selects the best option for a given context. Although HRL has been demonstrated to be promising, current state-of-the-art methods cannot still perform well in complex real-world problems due to the difficulty of identifying modes of the reward function. In this paper, we propose a novel method called hierarchical policy search via return-weighted density estimation (HPSDE), which can efficiently identify the modes through density estimation with return-weighted importance sampling. Our proposed method finds option policies corresponding to the modes of the return function and automatically determines the number and the location of option policies, which significantly reduces the burden of hyper-parameters tuning. Through experiments, we demonstrate that the proposed HPSDE successfully learns option policies corresponding to modes of the return function and that it can be successfully applied to a challenging motion planning problem of a redundant robotic manipulator.

연구 동기 및 목표

  • 계층 강화 학습을 위한 다중 모드 수익 함수에서 모드의 수와 위치를 식별하는 문제에 대응하기 위해.
  • 기존 방법에서 성능에 결정적인 영향을 미치는 옵션 정책의 수와 같은 수동적인 초모수 조정에 의존도를 줄이기 위해.
  • 각 정책이 수익 함수의 단일 모드에 집중하도록 자동으로 옵션 정책을 발견함으로써, 모드 간 정책 평균화를 방지하기 위해.
  • 사전 훈련이나 초기화 민감도 없이 게이팅 정책과 옵션 정책을 동시에 학습하는 방법을 개발하기 위해.

제안 방법

  • HPSDE는 수익 가중 밀도 추정을 사용하여 계층 정책 탐색 문제를 수익 분포의 모드를 식별하는 혼합 모델로 재정의한다.
  • 높은 수익 영역을 강조하기 위해 수익 가중 중요도 샘플링을 사용하여 궤도를 재가중함으로써 더 정확한 밀도 추정을 수행한다.
  • 기대 수익 가중 궤도의 가능도를 최대화함으로써 게이팅 정책과 옵션 정책을 동시에 최적화하는 EM 유사 알고리즘을 사용한다.
  • 옵션 정책은 표준 정책 탐색 방법(예: REPS)을 통해 학습되며, 게이팅 정책은 맥락에 따라 옵션 선택을 포괄할 수 있도록 가우시안 프로세스로 모델링된다.
  • 옵션 정책의 수는 밀도 추정을 통해 자동으로 결정되어 사전에 지정할 필요가 없다.
  • 기대 수익 최적화와 수익 가중 밀도 추정 간 이론적 연결을 수립함으로써, 본 방법의 목적 함수에 대한 정당성을 제시한다.

실험 결과

연구 질문

  • RQ1수익 가중 밀도 추정은 계층 강화 학습을 위한 다중 모드 수익 함수에서 모드의 수와 위치를 효과적으로 식별할 수 있는가?
  • RQ2샘플 효율성과 최종 성능 측면에서 HPSDE는 최신 기술의 계층 강화 학습 방법보다 어떻게 성능을 내는가?
  • RQ3HPSDE는 수동 조정이나 사전 훈련 없이 최적의 옵션 정책 수를 자동으로 결정할 수 있는가?
  • RQ4HPSDE는 연속적이고 고차원적인 행동 공간을 가진 복잡한 운동 계획 과제에서 다양하고 높은 성능을 내는 정책을 얼마나 잘 발견할 수 있는가?
  • RQ5기존 방법과 비교해 HPSDE는 초기화 및 초모수 선택에 대해 얼마나 강건한가?

주요 결과

  • HPSDE는 7-DOF 로봇 암을 사용한 시뮬레이션 운동 계획 과제에서 수익 함수의 다양한 모드에 대응하는 다수의 구분되는 옵션 정책을 성공적으로 학습했다.
  • 다중 자유도 암 과제에서 HPSDE는 REPS와 GP 기반 게이팅 정책을 사용하여 HiREPS조차도 히우리스틱 초모수로 조정된 경우보다 뛰어난 성능을 달성했다.
  • HPSDE는 사용자가 지정한 최대 정책 수 이외의 제한 없이 옵션 정책 수(최대 10개)를 자동으로 결정했다. 반면 HiREPS는 최소/최대 정책 수를 수동 조정이 필요했다.
  • 초기화에 대한 강건성과 초모수 민감도가 감소한 것으로 나타났으며, 유일한 개방형 초모수는 최대 정책 수 뿐이었다.
  • HPSDE는 기둥 뒤의 목표 지점에 도달하기 위한 다수의 유효한 자세를 발견함으로써, 연속적이고 고차원적인 상태 및 행동 공간에서 다양한 해답을 발견할 수 있음을 확인했다.
  • HPSDE의 계산 비용은 다른 방법들과 유사했으며, 주요 성능 저하 요소는 GP 기반 게이팅 정책 학습이었으며, 이는 이미지와 같은 고차원 입력으로의 확장성에 제약을 가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.