Skip to main content
QUICK REVIEW

[논문 리뷰] Model-Based Reinforcement Learning via Latent-Space Collocation

Oleh Rybkin, Chuning Zhu|arXiv (Cornell University)|2021. 06. 24.
Reinforcement Learning in Robotics인용 수 7
한 줄 요약

이 논문은 행동 대신 잠재 상태의 시퀀스를 최적화함으로써 장기적이고 시각 기반의 결정 문제를 향상시키는 모델 기반 강화학습 방법인 LatCo를 제안한다. 학습된 잠재 동역학 모델을 활용하고, 공백 기반 궤도 최적화를 적용함으로써, 이전의 샘플링 기반 방법이 실패하는 희박 보상 및 장기적 시각적 로봇 조작 작업에서 뛰어난 성능을 달성한다. 특히 불확실성 하에서 성능이 뛰어나다.

ABSTRACT

The ability to plan into the future while utilizing only raw high-dimensional observations, such as images, can provide autonomous agents with broad capabilities. Visual model-based reinforcement learning (RL) methods that plan future actions directly have shown impressive results on tasks that require only short-horizon reasoning, however, these methods struggle on temporally extended tasks. We argue that it is easier to solve long-horizon tasks by planning sequences of states rather than just actions, as the effects of actions greatly compound over time and are harder to optimize. To achieve this, we draw on the idea of collocation, which has shown good results on long-horizon tasks in optimal control literature, and adapt it to the image-based setting by utilizing learned latent state space models. The resulting latent collocation method (LatCo) optimizes trajectories of latent states, which improves over previously proposed shooting methods for visual model-based RL on tasks with sparse rewards and long-term goals. Videos and code at https://orybkin.github.io/latco/.

연구 동기 및 목표

  • 장기적이고 고차원적인 시각 기반 강화학습 작업에서 행동 기반 계획의 한계를 해결하기 위해.
  • 이미지 공간에서 직접 계획을 수행하는 대신, 압축된 학습된 잠재 공간에서 계획을 수행함으로써 신용 할당과 궤도 최적화를 향상시키기 위해.
  • 기존의 결정론적 방법과 달리 미래 상태 분포를 모델링함으로써 불확실성 하에서도 효과적인 계획을 가능하게 하기 위해.
  • 딥 랜덤 동역학 모델을 사용하여 공백 기반 최적 제어 기법을 이미지 관측치로 확장하기 위해.
  • 보상 형태 조정이 필요 없이 기존의 모델 기반 강화학습 프레임워크를 향상시키는 즉시 사용 가능한 최적화기 제공하기 위해.

제안 방법

  • LatCo는 고차원 관측치(이미지)를 저차원의 마르코프 잠재 공간으로 매핑하기 위해 변동형 오토인코더 기반의 잠재 동역학 모델을 사용한다.
  • 궤도 최적화를 제약 최적화 문제로 공식화한다: 누적 보상 최대화와 상태 전이 제약 $ s_{t+1} = f(s_t, a_t) $ 를 통한 동역학 탈리티 확보.
  • 기울기 기반 최적화를 사용하여 샘플링 기반의 샷 기반 방법보다 향상된 성능을 내기 위해 잠재 상태와 행동의 시퀀스를 함께 최적화한다.
  • 결정론적 계획과 확률적 계획을 모두 지원하며, 가우시안 LatCo는 미래 상태의 불확실성을 모델링하여 불확실한 환경에서의 내성 강도를 향상시킨다.
  • 모든 미분 가능한 동역학 모델과 호환되며, 기존의 모델 기반 강화학습 파ip라인에 즉시 사용 가능한 최적화기로 통합될 수 있다.
  • 문제에 특화된 효율적인 최적화기를 사용하여 계산 비용을 줄여, 최적화 변수 수가 증가함에도 불구하고 실용적인 구현을 가능하게 한다.

실험 결과

연구 질문

  • RQ1학습된 잠재 공간에서 공백 기반 궤도 최적화가 장기적이고 시각 기반 강화학습 작업에서 행동 기반 샘플링 방법보다 뛰어나게 성능을 높일 수 있는가?
  • RQ2잠재 상태 공간에서의 계획은 희박 보상 및 장기적 작업에서 신용 할당과 수렴을 어떻게 향상시키는가?
  • RQ3샘플링 기반 방법이 실패하는 불확실한 환경에서 LatCo는 효과적으로 불확실성을 다룰 수 있는가?
  • RQ4확률적 잠재 상태 표현을 사용할 경우 평균 기반 계획보다 더 나은 기대 보상 추정치를 제공하는가?
  • RQ5보상 형태 조정 없이도 고도로 복잡한 시각적 조작 작업에 대해 LatCo는 스케일업이 가능한가?

주요 결과

  • LatCo는 CEM 및 샘플링 기반 접근 방식을 포함한 모든 베이스라인 방법보다 장기적 도구 사용 및 탐색 작업에서 희박 보상 환경에서 뛰어난 성능을 보였다.
  • 로또 테스크에서, 오직 가우시안 LatCo만 불확실성을 고려하여 탑 목표를 정확히 계획했고, 결정론적 방법과 CEM은 낙관적 또는 비관적인 편향으로 인해 실패했다.
  • LatCo는 높은 샘플 효율성과 일반화 능력을 보였으며, 동일한 학습 예산 내에서 이전의 시각 기반 모델 기반 강화학습 방법이 학습에 실패한 작업을 해결했다.
  • LatCo는 불확실한 환경에서 뛰어난 내성 강도를 보였으며, 가우시안 LatCo는 여러 랜덤 시드와 작업 변형에서 안정적인 성능을 기록했다.
  • LatCo는 보상 형태 조정과 수동 커리큘럼 설계에 대한 의존도를 줄였고, 복잡하고 시간이 오래 걸리는 작업에 대해 엔드 투 엔드 학습을 가능하게 했다.
  • 실험 결과에 따르면 LatCo의 잠재 공간 최적화 방식은 이미지 공간의 공백 최적화나 행동 공간의 샷 기반 방법보다 더 빠른 수렴과 더 높은 최종 성능를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.