Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Abstract Options

Matthew Riemer, Miao Liu|arXiv (Cornell University)|2018. 01. 01.
Reinforcement Learning in Robotics인용 수 30
한 줄 요약

이 논문은 내재 보상 또는 보조 목표 없이도 다중 시간 해상도에서 시간적으로 추상화된 옵션을 종단 간 학습할 수 있도록 하는 딥 히에라르키컬 옵션-크리틱 프레임워크를 제안한다. 정책 그래ient 정리의 범위를 임의로 깊은 옵션 계층까지 확장함으로써, 내부 정책, 종료 조건, 구성적 구조를 학습한다. 이는 이산 및 연속 제어 환경 모두에서 샘플 효율성을 향상시킨다.

ABSTRACT

Building systems that autonomously create temporal abstractions from data is a key challenge in scaling learning and planning in reinforcement learning. One popular approach for addressing this challenge is the options framework (Sutton et al., 1999). However, only recently in (Bacon et al., 2017) was a policy gradient theorem derived for online learning of general purpose options in an end to end fashion. In this work, we extend previous work on this topic that only focuses on learning a two-level hierarchy including options and primitive actions to enable learning simultaneously at multiple resolutions in time. We achieve this by considering an arbitrarily deep hierarchy of options where high level temporally extended options are composed of lower level options with finer resolutions in time. We extend results from (Bacon et al., 2017) and derive policy gradient theorems for a deep hierarchy of options. Our proposed hierarchical option-critic architecture is capable of learning internal policies, termination conditions, and hierarchical compositions over options without the need for any intrinsic rewards or subgoals. Our empirical results in both discrete and continuous environments demonstrate the efficiency of our framework.

연구 동기 및 목표

  • 강화 학습의 스케일링 문제를 해결하기 위해 다중 시간 해상도에서 자율적으로 시간적 추상화를 학습할 수 있도록 하는 것.
  • 옵션 프레임워크를 이중 계층을 넘어서 임의로 깊은 옵션 조합을 지원하는 방향으로 확장하는 것.
  • 딥 옵션 계층에 대한 정책 그래ient 정리를 유도함으로써 내부 정책과 종료 조건의 종단 간 훈련을 가능하게 하는 것.
  • 내재 보상 또는 수동으로 지정된 보조 목표에 의존하지 않고 히에라르키컬 옵션을 학습하는 것.
  • 다양한 환경에서 제안된 프레임워크의 효율성과 확장성의 실증

제안 방법

  • 논문은 Bacon 등 (2017)의 정책 그래ient 정리를 심화된 옵션 계층을 지원하도록 확장하여, 다중 수준의 시간적 추상화를 통해 기반으로 하는 기반 학습을 가능하게 한다.
  • 다양한 수준에서 옵션 정책, 종료 조건, 구성적 구조를 동시에 학습할 수 있는 히에라르키컬 옵션-크리틱 아키텍처를 도입한다.
  • 계층의 깊이를 임의로 지원하며, 고수준 옵션은 더 세밀한 시간 해상도를 가진 저수준 옵션으로 구성된다.
  • 모든 구성 요소—정책, 종료 조건, 구성—에 대해 보조 감독이나 내재 보상 없이 종단 간 방식으로 훈련된다.
  • 모든 구성 요소를 동시에 최적화하기 위해 계층적 옵션 구조를 통해 그래디언트를 전파하는 크레딧 할당 메커니즘을 사용한다.

실험 결과

연구 질문

  • RQ1내재 보상 또는 보조 목표 없이도 히에라르키컬 옵션-크리틱 프레임워크가 다중 시간 해상도에서 시간적으로 연장된 옵션을 학습할 수 있는가?
  • RQ2제안된 정책 그래ient 정리는 이중 계층을 넘어서는 깊은 옵션 계층에 어떻게 일반화되는가?
  • RQ3히에라르키컬 조합은 복잡한 환경에서 샘플 효율성과 학습 성능에 어떤 영향을 미치는가?
  • RQ4이 프레임워크는 이산 및 연속 제어 작업에서 다양한 수준의 시간적 추상화에 어떻게 스케일링되는가?

주요 결과

  • 제안된 프레임워크는 내재 보상 또는 보조 목표 없이도 다중 시간 해상도에서 내부 정책, 종료 조건, 히에라르키컬 조합을 성공적으로 학습한다.
  • 다중 해상도 시간적 추상화의 활용 덕분에 이산 및 연속 제어 환경 모두에서 샘플 효율성이 향상된다.
  • 딥 히에라르키컬 구조는 평탄하거나 浅은 옵션 구조보다 더 효과적인 크레딧 할당과 더 빠른 수렴을 가능하게 한다.
  • 실험 결과는 프레임워크가 다양한 환경에서 일반화됨을 확인하며, 히에라르키컬 강화 학습에서 강건성과 확장성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.