Skip to main content
QUICK REVIEW

[논문 리뷰] Goal-Conditioned Reinforcement Learning with Imagined Subgoals

Elliot Chane-Sane, Cordelia Schmid|arXiv (Cornell University)|2021. 07. 01.
Reinforcement Learning in Robotics인용 수 26
한 줄 요약

본 논문은 RIS를 소개한다. 목표 조건 정책을 고수준 정책이 생성한 상상된 서브목표로 학습시키고, 사전에 대한 KL-발산으로 정규화하는 방식으로 시간적으로 확장된 작업의 학습을 가속하며; 테스트 시에는 평면 정책만 사용된다.

ABSTRACT

Goal-conditioned reinforcement learning endows an agent with a large variety of skills, but it often struggles to solve tasks that require more temporally extended reasoning. In this work, we propose to incorporate imagined subgoals into policy learning to facilitate learning of complex tasks. Imagined subgoals are predicted by a separate high-level policy, which is trained simultaneously with the policy and its critic. This high-level policy predicts intermediate states halfway to the goal using the value function as a reachability metric. We don't require the policy to reach these subgoals explicitly. Instead, we use them to define a prior policy, and incorporate this prior into a KL-constrained policy iteration scheme to speed up and regularize learning. Imagined subgoals are used during policy learning, but not during test time, where we only apply the learned policy. We evaluate our approach on complex robotic navigation and manipulation tasks and show that it outperforms existing methods by a large margin.

연구 동기 및 목표

  • 목표 조건 RL이 시간적으로 확장된 추론을 처리하도록 동기를 부여
  • 정책 학습을 안내하고 가속하기 위한 상상된 서브목표를 제안
  • 서브목표를 예측하는 고수준 정책과 KL-정규화를 위한 사전을 학습
  • 테스트 시에 먼 목표에 도달할 수 있는 단일 평면 정책을 가능하게
  • 시뮬레이션 로봇 내비게이션 및 조작 태스크에서 샘플 효율적 학습을 시연

제안 방법

  • 목표 정책 및 비평가와 함께 공동으로 학습되는 고수준 정책에 의해 예측된 상상된 서브목표 도입
  • 상상된 서브목표에 도달하기 위한 행동 분포로서의 사전 정책을 정의하고, 이 사전 toward KL 제약으로 목표 조건 정책을 정규화
  • 현재 가치 함수를 이용하여 상태 간 거리를 정의하고 서브목표 선택을 안내
  • horizon를 줄이기 위해 목표로의 경로 중간점으로 서브목표를 예측
  • 비모수적 고수준 정책을 학습하고 KL 기반 업데이트(Eq. 6–7)를 통해 매개 공간으로 투영
  • 희소 보상에 대해 HER를 활용하는 오프-폴리시 액터-비평 프레임워크(Algorithm 1)

실험 결과

연구 질문

  • RQ1상상된 서브목표가 장기 로드맵 태스크에서 목표 조건 RL의 학습 속도를 가속할 수 있는가?
  • RQ2고수준 정책이 평면 정책을 효과적으로 정규화하고 안내하는 서브목표를 어떻게 예측하는가?
  • RQ3서브목목으로 inform된 사전에 KL-정규화가 안정성과 샘플 효율성을 향상시키는가?
  • RQ4RIS가 네비게이션 태스크에서 화면 입력이 있는 비전 기반 조작으로 일반화하는가?
  • RQ5서브목표로 학습하더라도 테스트 시간에 하나의 정책으로 성능을 달성하는가?

주요 결과

  • RIS는 ant 내비게이션 미로 및 비전 기반 조작 전반에서 SAC+HER, LEAP, TDM에 비해 샘플 효율을 크게 향상시킨다
  • 고수준 정책은 학습 중 오라클(경로의 중간점)에 일관된 서브목표를 학습한다
  • 암묵적 KL-정규화가 상상된 서브목표를 유효한 상태 분포 내에 유지하여 발산을 방지한다
  • 비전 태스크에서 상상된 서브목표를 통해 RIS가 더 적은 연산으로 SAC 및 LEAP를 능가(단일 순전파 대 계획 대비)한다
  • 이동 평균을 통한 평균 서브목표 사전은 학습을 안정시키고 수렴을 돕는다
  • RIS는 기존 방법이 어려워하는 점진적으로 어려워지는 horizon 태스크를 해결한다

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.