Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Reinforcement Learning By Discovering Intrinsic Options

Jesse Zhang, Haonan Yu|arXiv (Cornell University)|2021. 01. 16.
Reinforcement Learning in Robotics참고 문헌 41인용 수 24
한 줄 요약

HIDIO는 작업에 구애받지 않는 내재적 옵션을 자기지도 학습 방식으로 학습하고 이를 결합하여 희소 보상 작업을 해결하며 베이스라인보다 샘플 효율이 더 높다.

ABSTRACT

We propose a hierarchical reinforcement learning method, HIDIO, that can learn task-agnostic options in a self-supervised manner while jointly learning to utilize them to solve sparse-reward tasks. Unlike current hierarchical RL approaches that tend to formulate goal-reaching low-level tasks or pre-define ad hoc lower-level policies, HIDIO encourages lower-level option learning that is independent of the task at hand, requiring few assumptions or little knowledge about the task structure. These options are learned through an intrinsic entropy minimization objective conditioned on the option sub-trajectories. The learned options are diverse and task-agnostic. In experiments on sparse-reward robotic manipulation and navigation tasks, HIDIO achieves higher success rates with greater sample efficiency than regular RL baselines and two state-of-the-art hierarchical RL methods.

연구 동기 및 목표

  • 희소 보상 작업을 위한 수동 옵션 설계 없이 자동 작업 분해를 동기화한다.
  • 스케줄러가 잠재 옵션을 선택하고 워커가 행동을 실행하는 두 수준의 계층 구조를 학습한다.
  • 내재 엔트로피 목표를 통해 다양하고 작업에 구애받지 않는 저수준 옵션을 촉진한다.
  • 자기지도 옵션 발견이 성공률과 효율성을 로봇 작업 전반에서 개선한다.

제안 방법

  • 스케줄러(상위 수준)가 매 K 스텝마다 잠재 옵션 u를 출력하고 워커(하위 수준)가 u에 conditioning되며 동작한다.
  • 옵션 발견은 디스크리미네이터 qψ를 사용하여 로그-qposterior p(u|trajectory)를 최대화하는 내재적 보상을 통해 이뤄진다.
  • 비실질적인 포스터리를 매개변수화된 디스크리미네이터로 대체하는 하한 최적화를 수행한다.
  • 메타-MDP를 정의하여 워커가 옵션 하위-경로를 관찰하게 하고 효과적인 구별과 크레딧 할당을 가능하게 한다.
  • 워커 목표는 내재 보상과 최대 엔트로피 RL 목표(SAC)를 결합하여 안정적인 학습을 촉진한다.
  • 하위-경로 특징에 대한 디스크리미네이터 구성을 (State, Action, StateDiff, StateAction, StateConcat, ActionConcat)로 평가한다.
  • 샘플 효율성을 높이기 위해 재생 버퍼를 사용하는 오프_POLICY 학습, 내재 보상 재레이블링, 선택적 중요 보정이 도입된다.

실험 결과

연구 질문

  • RQ1자기지도 방식으로 학습된 작업-무관 내재 옵션이 희소 보상 작업에서 성능을 향상시킬 수 있는가?
  • RQ2옵션 하위-경로에서 디스크리미네이터가 다양하고 효과적으로 옵션을 발견하도록 어떻게 작동해야 하는가?
  • RQ3일괄 학습으로 스케줄러와 워커를 함께 학습하는 것이 고정된 옵션으로 워커를 사전 학습하는 것보다 더 나은가?
  • RQ4학습 및 성능에 대해 서로 다른 근시안성(short-sightedness) 및 옵션 길이가 어떤 영향을 미치는가?
  • RQ5HIDIO의 내재 옵션이 조작 및 탐색 작업에서 기존의 계층 RL 방법과 어떻게 비교되는가?

주요 결과

  • HIDIO는 네 가지 다양한 작업에서 SAC, SAC+ActRepeat, HIRO, HiPPO보다 최종 성공률이 더 높고 샘플 효율이 더 좋다.
  • Action, StateAction, StateDiff와 같은 디스크리미네이터 특징 선택이 일반적으로 더 강력한 성능을 내는 경향이 있다.
  • 스케줄러와 워커를 함께 학습하는 것이 도전적 작업에서 고정 옵션으로 워커를 미리 학습하는 것보다 우수하다.
  • 학습된 옵션은 탐색과 작업 완료를 촉진하는 저수준의 탐색 및 조작 기술로 작동한다.
  • HIDIO는 베이스라인이 어려운 희소 보상 작업을 해결할 수 있다, 내재적이고 단기적인 옵션 발견의 가치를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.