[논문 리뷰] Learning and Exploiting Multiple Subgoals for Fast Exploration in Hierarchical Reinforcement Learning
이 논문은 수동으로 설계하지 않고 데이터로부터 학습된 다중 하위목표—픽셀 제어, 특징 제어, 방향 제어—를 동시에 사용하여 희박 보상 환경에서 탐색 효율성을 향상시키는 다중 목표 계층 강화 학습(HRL) 알고리즘을 제안한다. 이 방법은 훈련 시간을 크게 단축하면서도 Atari의 Montezuma’s Revenge에서 최신 기술 수준의 성능을 유지하며, 하위목표가 최적화되지 않은 경우에도 빠른 수렴성과 강건성을 보여준다.
Hierarchical Reinforcement Learning (HRL) exploits temporally extended actions, or options, to make decisions from a higher-dimensional perspective to alleviate the sparse reward problem, one of the most challenging problems in reinforcement learning. The majority of existing HRL algorithms require either significant manual design with respect to the specific environment or enormous exploration to automatically learn options from data. To achieve fast exploration without using manual design, we devise a multi-goal HRL algorithm, consisting of a high-level policy Manager and a low-level policy Worker. The Manager provides the Worker multiple subgoals at each time step. Each subgoal corresponds to an option to control the environment. Although the agent may show some confusion at the beginning of training since it is guided by three diverse subgoals, the agent's behavior policy will quickly learn how to respond to multiple subgoals from the high-level controller on different occasions. By exploiting multiple subgoals, the exploration efficiency is significantly improved. We conduct experiments in Atari's Montezuma's Revenge environment, a well-known sparse reward environment, and in doing so achieve the same performance as state-of-the-art HRL methods with substantially reduced training time cost.
연구 동기 및 목표
- 보상 빈도가 적고 지연되는 상황에서 에이전트가 학습하기 어려운 강화 학습의 희박 보상 문제를 해결한다.
- 기존 HRL 방법이 수동으로 하위목표를 설계하거나 탐색 효율성이 떨어지는 문제를 극복한다.
- 환경에 특화된 사전 지식 없이 동시에 여러 하위목표를 활용하여 복잡한 환경에서의 탐색 효율성을 향상시킨다.
- 다양한 하위목표 가이드라인을 통해 학습 속도와 강건성을 향상시키며, 일부 하위목표가 비효율적일 경우에도 성능을 유지함을 입증한다.
제안 방법
- 고수준의 매니저 정책과 저수준의 워커 정책으로 구성된 이중 수준의 HRL 아키텍처를 도입하며, 매니저는 각 시간 단계에서 다수의 하위목표를 생성한다.
- 세 가지 유형의 하위목표를 정의한다: 픽셀 제어(특정 픽셀 조작), 특징 제어(학습된 시각적 특징 제어), 방향 제어(이동 방향 제어) — 모두 데이터로부터 학습된다.
- 다양한 하위목표에서 유도된 내재 보상으로 워커 정책을 훈련시켜 병렬로 다양한 행동을 학습하도록 한다.
- 매니저 내 각 하위목표에 대해 독립적인 액터-크리틱 네트워크를 사용하여 동일한 훈련 데이터 스트림을 공유하면서도 독립적으로 최적화할 수 있도록 한다.
- 워커가 단일 하위목표를 선택하는 것이 아니라 동시에 모든 하위목표에 의해 안내되도록 다중 하위목표 탐색 전략을 적용하여 정책 학습을 가속화한다.
- 하위목표를 일반화 가능하고 환경에 종속되지 않도록 설계하여 수동 공학에 의존도를 최소화한다.
실험 결과
연구 질문
- RQ1단일 하위목표 HRL과 비교해 복수의 데이터 기반 하위목표를 동시에 사용할 경우, 희박 보상 환경에서 탐색 효율성이 향상되는가?
- RQ2Montezuma’s Revenge와 같은 환경에서 다중 하위목표 HRL 에이전트의 성능은 최신 기술 수준의 HRL 및 비계층적 강화 학습 방법과 비교해 어떻게 되는가?
- RQ3비효율적이거나 무작위의 하위목표가 포함된 경우 제안된 다중 하위목표 프레임워크는 얼마나 강건한가?
- RQ4하위목표의 수가 학습 속도와 최종 성능에 얼마나 영향을 미치는가?
주요 결과
- Montezuma’s Revenge에서 제안된 다중 하위목표 HRL 에이전트는 최신 기술 수준의 HRL 방법과 동일한 최고 점수를 기록했지만 훨씬 적은 훈련 시간을 소요하여 탐색 효율성이 뛰어나다는 것을 입증했다.
- Alien 환경에서 세 하위목표 에이전트는 동일한 훈련 스텝 수 내에서 FuN 및 특징 제어 에이전트보다 거의 두 배 높은 점수를 기록했다.
- 세 하위목표를 하나로 줄였을 때 훈련 효율성이 크게 떨어졌으며, 특히 Montezuma’s Revenge에서 두드러졌다. 이는 다중 하위목표 설정의 필수성을 확인한다.
- 무작위(나쁜) 하위목표를 포함시켜도 성능 저하가 미미하게 발생하여, 알고리즘이 비효율적 하위목표에 대해 강건함을 보였다.
- Frostbite 환경에서 세 하위목표 에이전트는 Option-critic 및 특징 제어 에이전트와 유사한 성능을 기록했지만 FuN에 비해 略로 떨어졌다. 이는 다양한 환경에서의 뛰어난 일반화 능력을 보여준다.
- 비계층적 Ape-X보다도 희박 보상 환경에서 성능이 뛰어나, 다중 하위목표 가이드라인을 갖춘 계층적 아키텍처의 우수성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.