Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Reinforcement Learning with Hindsight

Andrew Levy, Robert W. Platt|arXiv (Cornell University)|2018. 05. 21.
Reinforcement Learning in Robotics참고 문헌 16인용 수 42
한 줄 요약

논문은 다중 추상 수준에서 시간적으로 확장된 행동을 학습하기 위해 universal value functions와 hindsight learning을 결합하는 방법을 제시하여, 시간 척도에 걸쳐 병렬 학습을 가능하게 하고 이산 및 연속 작업에서 샘플 효율성을 향상시킨다.

ABSTRACT

Reinforcement Learning (RL) algorithms can suffer from poor sample efficiency when rewards are delayed and sparse. We introduce a solution that enables agents to learn temporally extended actions at multiple levels of abstraction in a sample efficient and automated fashion. Our approach combines universal value functions and hindsight learning, allowing agents to learn policies belonging to different time scales in parallel. We show that our method significantly accelerates learning in a variety of discrete and continuous tasks.

연구 동기 및 목표

  • 지연되거나 희소한 보상으로 인한 RL의 샘플 비효율성을 해결한다.
  • 다중 추상 수준에서 시간적으로 확장된 행동 학습을 가능하게 한다.
  • 다른 시간 스케일에서 정책을 병렬로 학습하는 방법을 개발한다.
  • 다중 시간 척도 학습을 촉진하기 위해 universal value functions와 hindsight learning을 통합한다.

제안 방법

  • 다른 목표와 시간 척도 전반에 걸쳐 가치를 표현하기 위해 universal value functions를 사용한다.
  • 더 풍부한 학습 신호를 위해 과거 경험을 대체 목표로 재구성하기 위해 hindsight learning을 적용한다.
  • 하나의 프레임워크 내에서 여러 시간적 수평선에서 정책의 병렬 학습을 가능하게 한다.
  • 샘플 효율적인 방식으로 서로 다른 추상 수준에서 행동을 학습하기 위해 계층적 구조를 활용한다.
  • 이 접근법을 이산 및 연속 제어 작업에 적용하여 일반성을 시연한다.

실험 결과

연구 질문

  • RQ1universal value functions와 hindsight learning을 결합하여 다중 시간 스케일에 걸친 시간적으로 확장된 행동 학습을 지원할 수 있는가?
  • RQ2제안된 계층적 접근법이 이산 및 연속 작업 모두에서 평면 RL 기반 대비 샘플 효율성을 향상시키는가?
  • RQ3상이한 시간 지평선의 정책들이 간섭 없이 병렬로 학습될 수 있는가?
  • RQ4hindsight 기반 재레이블링이 계층적 수준 전반의 학습 속도와 정책 품질에 어떻게 영향을 미치는가?
  • RQ5 RL에서 다중 시간 규모 학습의 자동화의 실용적 이점과 한계는 무엇인가?

주요 결과

  • 이 방법은 다양한 이산 작업에서 학습 속도를 가속화한다.
  • 연속 작업에서도 학습 속도를 가속화한다.
  • 다양한 시간 척도에서 병렬로 학습이 일어나 샘플 효율성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.