Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Reinforcement Learning with Advantage-Based Auxiliary Rewards

Siyuan Li, Rui Wang|arXiv (Cornell University)|2019. 10. 10.
Software Engineering Research인용 수 37
한 줄 요약

HAAR는 HRL에서 이점 기반 보조 보상을 도입하여 고수준 정책과 저수준 기술을 동시에 학습시켜 학습 효율성과 이전 가능성을 향상시키며 작업 특정 보상 shaping 없이도 가능하다.

ABSTRACT

Hierarchical Reinforcement Learning (HRL) is a promising approach to solving long-horizon problems with sparse and delayed rewards. Many existing HRL algorithms either use pre-trained low-level skills that are unadaptable, or require domain-specific information to define low-level rewards. In this paper, we aim to adapt low-level skills to downstream tasks while maintaining the generality of reward design. We propose an HRL framework which sets auxiliary rewards for low-level skill training based on the advantage function of the high-level policy. This auxiliary reward enables efficient, simultaneous learning of the high-level policy and low-level skills without using task-specific knowledge. In addition, we also theoretically prove that optimizing low-level skills with this auxiliary reward will increase the task return for the joint policy. Experimental results show that our algorithm dramatically outperforms other state-of-the-art HRL methods in Mujoco domains. We also find both low-level and high-level policies trained by our algorithm transferable.

연구 동기 및 목표

  • 계층적 정책으로 긴 기간의 희소 보상 문제 해결에 대한 동기를 부여한다.
  • 도메인 특화 보상에 의존하지 않고도 하위 수준 기술을 다운스트림 작업에 적응시키는 것을 가능하게 한다.
  • 더 나은 효율성과 이전 가능성을 위해 고수준 정책과 저수준 정책을 동시에 학습시키는 방법을 개발한다.

제안 방법

  • 저수준 기술을 선택하는 이산적 고수준 동작을 갖는 두 계층 HRL.
  • k 단계 동안 실행되는 고수준 동작에 조건화된 저수준 정책.
  • 저수준 기술 학습을 안내하기 위해 고수준 이점 함수로부터 계산된 보조 저수준 보상.
  • 고수준 이점을 한 단계 추정하여 r_l를 A_h(s^h_t,a^h_t) / k 로부터 도출한다.
  • 기술 길이 어닐링: k_i = k_1 * exp(-tau * i) 탐험과 정밀도 간의 균형을 맞추기 위해.
  • 각 계층이 각자의 목표로 최적화될 때 결합 정책이 증가한다는 단조 개선 증명을 보여준다.

실험 결과

연구 질문

  • RQ1고수준 이점 함수에 기반한 보조 보상이 작업 독립적으로 저수준 기술 학습을 안내할 수 있는가?
  • RQ2고수준과 저수준 정책의 동시 최적화가 결합 정책의 단조 개선을 보존하는가?
  • RQ3사전 학습된 다양한 저수준 기술이 고수준 학습 및 전반적인 성능 가속에 유익한가?
  • RQ4어닐링된 장기 실행 길이가 최종 정책 품질을 변화시키지 않으면서 학습 속도를 높이는가?
  • RQ5학습된 고수준 및 저수준 정책이 유사한 작업에 전이 가능한가?

주요 결과

  • HAAR는 Mujoco 희소 보상 작업에서 최첨단 HRL 방법보다 상당히 우수하다.
  • 고수준 이점을 기반으로 한 보조 보상은 다운스트림 작업에 대한 저수준 기술의 적응을 향상시킨다.
  • 기술 길이 어닐링은 최종 정책 성능을 변화시키지 않으면서 학습 속도를 가속화한다.
  • HAAR로 학습된 고수준 및 저수준 정책은 유사한 다운스트림 작업에 전이 가능하다.
  • 이 방법은 SNN4HRL, HAC, HIRO, TRPO와 같은 베이스라인보다 수렴이 빠르고 최종 성능이 더 높다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.