Skip to main content
QUICK REVIEW

[논문 리뷰] Learning World Graphs to Accelerate Hierarchical Reinforcement Learning

Wenling Shang, Alex Trott|arXiv (Cornell University)|2019. 07. 01.
Reinforcement Learning in Robotics인용 수 10
한 줄 요약

이 논문은 비지도 탐색을 통해 세계 그래프(핵심 상태와 통행 가능한 간선으로 구성됨)를 학습하는 이단계 프레임워크를 제안하여 계층 강화 학습(HRL)의 속도를 향상시킨다. 궁금증을 자극하는 목표 조절 정책과 미분 가능한 이진 잠복 모델을 사용함으로써, 핵심 상태와 연결을 발견할 수 있으며, 이는 고수준의 매니저가 '넓은 후 좁은' 지시를 내려 저수준의 워커가 그래프 탐색을 통해 효율적으로 최종 작업을 해결하도록 이끈다. 이는 기존의 기준보다 샘플 효율성과 성능을 크게 향상시킨다.

ABSTRACT

In many real-world scenarios, an autonomous agent often encounters various tasks within a single complex environment. We propose to build a graph abstraction over the environment structure to accelerate the learning of these tasks. Here, nodes are important points of interest (pivotal states) and edges represent feasible traversals between them. Our approach has two stages. First, we jointly train a latent pivotal state model and a curiosity-driven goal-conditioned policy in a task-agnostic manner. Second, provided with the information from the world graph, a high-level Manager quickly finds solution to new tasks and expresses subgoals in reference to pivotal states to a low-level Worker. The Worker can then also leverage the graph to easily traverse to the pivotal states of interest, even across long distance, and explore non-locally. We perform a thorough ablation study to evaluate our approach on a suite of challenging maze tasks, demonstrating significant advantages from the proposed framework over baselines that lack world graph knowledge in terms of performance and efficiency.

연구 동기 및 목표

  • 복잡하고 다중 작업 환경에서 계층 강화 학습의 샘플 비효율성과 낮은 일반화 능력 문제를 해결하기 위해.
  • 인간이 제공한 지형 기준점 없이도 환경의 구조적 본질을 담은 방향성 있는 가중치가 부여된 그래프 형태의 압축되고 의미 있는 세계 추상화를 발견하기 위해.
  • 세계 그래프 지식을 계층 정책에 통합하여 최종 작업 학습을 가속화하고, 새로운 목표 지시 및 탐색 메커니즘을 도입하기 위해.
  • 세계 그래프 발견 단계 동안 유도된 궁금증을 자극하는 목표 조절 정책을 기반으로 HRL 정책를 초기화함으로써 빠른 전이 학습을 가능하게 하기 위해.

제안 방법

  • 행동 궤적 재구성을 가능하게 하는 핵심 상태를 식별하기 위해 이진 잠복 변수를 가진 순환 변동형 자동에코더를 학습한다.
  • 다양한 궤적을 수집하기 위해 무작위 보행과 궁금증을 자극하는 목표 조절 정책을 번갈아 적용하는 비지도 탐색 전략을 사용하여 세계 그래프 학습에 활용한다.
  • 근처의 핵심 상태 간에 실현 가능하고 행동 가능한 전이를 기반으로 세계 그래프의 간선을 구성하며, 이는 궤적과 목표 조절 정책 양측에서 유도된다.
  • 고수준의 매니저가 먼저 핵심 상태를 선택하고, 그 지역 내에서 목표를 명시할 수 있도록 하는 새로운 '넓은 후 좁은'(WN) 지시 메커니즘이 도입된다.
  • 저수준의 워커는 그래프 탐색 알고리즘(예: 다익스트라 유사 알고리즘)을 사용하여 한 핵심 상태에서 다른 핵심 상태로 효율적으로 이동하며, 장거리 비국소적 탐색을 가능하게 한다.
  • 세계 그래프 발견 단계 동안 학습된 목표 조절 정책(πg)을 재사용하여 HRL 정책를 초기화함으로써 새로운 작업에 대한 빠른 전이 학습이 가능해진다.

실험 결과

연구 질문

  • RQ1자기지도적, 비지도 방법이 복잡한 환경의 구조적 뼈대를 형성하는 핵심 상태를 효과적으로 발견할 수 있는가?
  • RQ2학습된 세계 그래프를 통합할 경우 계층 강화 학습의 샘플 효율성과 최종 성능이 어떻게 향상되는가?
  • RQ3'넓은 후 좁은' 지시 메커니즘이 표준 목표 조절 HRL에 비해 수렴 속도와 해법 품질 측면에서 얼마나 뛰어나게 작용하는가?
  • RQ4재학습 없이도 다양한 최종 작업에 대해 세계 그래프 추상화가 일반화 가능한가?
  • RQ5세계 그래프 발견 단계에서 학습된 궁금증을 자극하는 정책을 기반으로 HRL 정책를 초기화할 경우, 새로운 작업에서 수렴 속도가 빨라지는가?

주요 결과

  • 학습된 세계 그래프가 샘플 효율성을 크게 향상시킨다: 세계 그래프를 사용하는 모델는 이를 사용하지 않는 기준 모델보다 더 빨리 수렴하고 더 높은 최종 성능를 달성한다.
  • 무작위 상태(Vrand) 대비 핵심 상태(Vp) 사용은 시드에 따른 성능 변동을 줄이며, 비결정성 환경에서 특히 일관되고 뛰어난 성능을 보인다.
  • 그래프 탐색 메커니즘이 학습을 가속화하며, 탐색 기능이 활성화된 경우 학습 곡선에서 더 빠른 수렴이 관찰된다.
  • '넓은 후 좁은' 지시 메커니즘이 표준 목표 조절 방식을 능가한다. 이는 그래프 구조를 활용해 매니저가 보다 효과적인 보조 목표 선택을 유도하기 때문이다.
  • 세계 그래프 발견 단계에서 얻은 목표 조절 정책(πg)을 초기화 값으로 사용할 경우 성능 향상이 뚜렷하게 나타나, 효과적인 기술 전이가 이루어짐을 입증한다.
  • 제거 실험 결과, 핵심 상태 발견, 그래프 탐색, WN 지시, πg 초기화 등 모든 구성 요소가 전체 성능 향상에 기여하고 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.