[논문 리뷰] Hierarchical Reinforcement Learning with Advantage-Based Auxiliary Rewards
HAAR는 HRL에서 이점 기반 보조 보상을 도입하여 고수준 정책과 저수준 기술을 동시에 학습시켜 학습 효율성과 이전 가능성을 향상시키며 작업 특정 보상 shaping 없이도 가능하다.
Hierarchical Reinforcement Learning (HRL) is a promising approach to solving long-horizon problems with sparse and delayed rewards. Many existing HRL algorithms either use pre-trained low-level skills that are unadaptable, or require domain-specific information to define low-level rewards. In this paper, we aim to adapt low-level skills to downstream tasks while maintaining the generality of reward design. We propose an HRL framework which sets auxiliary rewards for low-level skill training based on the advantage function of the high-level policy. This auxiliary reward enables efficient, simultaneous learning of the high-level policy and low-level skills without using task-specific knowledge. In addition, we also theoretically prove that optimizing low-level skills with this auxiliary reward will increase the task return for the joint policy. Experimental results show that our algorithm dramatically outperforms other state-of-the-art HRL methods in Mujoco domains. We also find both low-level and high-level policies trained by our algorithm transferable.
연구 동기 및 목표
- 계층적 정책으로 긴 기간의 희소 보상 문제 해결에 대한 동기를 부여한다.
- 도메인 특화 보상에 의존하지 않고도 하위 수준 기술을 다운스트림 작업에 적응시키는 것을 가능하게 한다.
- 더 나은 효율성과 이전 가능성을 위해 고수준 정책과 저수준 정책을 동시에 학습시키는 방법을 개발한다.
제안 방법
- 저수준 기술을 선택하는 이산적 고수준 동작을 갖는 두 계층 HRL.
- k 단계 동안 실행되는 고수준 동작에 조건화된 저수준 정책.
- 저수준 기술 학습을 안내하기 위해 고수준 이점 함수로부터 계산된 보조 저수준 보상.
- 고수준 이점을 한 단계 추정하여 r_l를 A_h(s^h_t,a^h_t) / k 로부터 도출한다.
- 기술 길이 어닐링: k_i = k_1 * exp(-tau * i) 탐험과 정밀도 간의 균형을 맞추기 위해.
- 각 계층이 각자의 목표로 최적화될 때 결합 정책이 증가한다는 단조 개선 증명을 보여준다.
실험 결과
연구 질문
- RQ1고수준 이점 함수에 기반한 보조 보상이 작업 독립적으로 저수준 기술 학습을 안내할 수 있는가?
- RQ2고수준과 저수준 정책의 동시 최적화가 결합 정책의 단조 개선을 보존하는가?
- RQ3사전 학습된 다양한 저수준 기술이 고수준 학습 및 전반적인 성능 가속에 유익한가?
- RQ4어닐링된 장기 실행 길이가 최종 정책 품질을 변화시키지 않으면서 학습 속도를 높이는가?
- RQ5학습된 고수준 및 저수준 정책이 유사한 작업에 전이 가능한가?
주요 결과
- HAAR는 Mujoco 희소 보상 작업에서 최첨단 HRL 방법보다 상당히 우수하다.
- 고수준 이점을 기반으로 한 보조 보상은 다운스트림 작업에 대한 저수준 기술의 적응을 향상시킨다.
- 기술 길이 어닐링은 최종 정책 성능을 변화시키지 않으면서 학습 속도를 가속화한다.
- HAAR로 학습된 고수준 및 저수준 정책은 유사한 다운스트림 작업에 전이 가능하다.
- 이 방법은 SNN4HRL, HAC, HIRO, TRPO와 같은 베이스라인보다 수렴이 빠르고 최종 성능이 더 높다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.