Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning with Action-Free Pre-Training from Videos

Younggyo Seo, Kimin Lee|arXiv (Cornell University)|2022. 03. 25.
Reinforcement Learning in Robotics인용 수 14
한 줄 요약

이 논문은 시각 기반 강화 학습에서 샘플 효율성과 최종 성능을 햖थ기 위해 동작에 의존하지 않는 비디오 사전 훈련을 사용하는 강화 학습 프레임워크인 APV를 제안한다. 다양한 동작에 영향을 받지 않는 비디오 데이터를 기반으로 잠재 비디오 예측 모델을 사전 훈련하고, 동작 조건부 동역학 모델로 미세 조정함으로써, 비디오 기반 내재 보상에 기반한 더 빠른 학습과 더 나은 탐색을 가능하게 한다. Meta-World 작업에서 95.4%의 성공률을 기록한 반면, DreamerV2는 67.9%에 그친다.

ABSTRACT

Recent unsupervised pre-training methods have shown to be effective on language and vision domains by learning useful representations for multiple downstream tasks. In this paper, we investigate if such unsupervised pre-training methods can also be effective for vision-based reinforcement learning (RL). To this end, we introduce a framework that learns representations useful for understanding the dynamics via generative pre-training on videos. Our framework consists of two phases: we pre-train an action-free latent video prediction model, and then utilize the pre-trained representations for efficiently learning action-conditional world models on unseen environments. To incorporate additional action inputs during fine-tuning, we introduce a new architecture that stacks an action-conditional latent prediction model on top of the pre-trained action-free prediction model. Moreover, for better exploration, we propose a video-based intrinsic bonus that leverages pre-trained representations. We demonstrate that our framework significantly improves both final performances and sample-efficiency of vision-based RL in a variety of manipulation and locomotion tasks. Code is available at https://github.com/younggyoseo/apv.

연구 동기 및 목표

  • 다양하고 동작에 영향을 받지 않는 비디오에서 비지도 사전 훈련을 통해 시각 기반 강화 학습의 샘플 효율성과 최종 성능을 향상시키기 위해.
  • 큰 도메인 갭이 존재하는 새로운 도메인(예: Meta-World 및 DeepMind Control Suite)으로의 사전 훈련된 표현의 전이를 가능하게 하기 위해.
  • 사전 훈련 단계에서는 동작 정보가 필요 없이, 미세 조정 단계에서 동작 입력을 통합할 수 있는 방법을 개발하기 위해.
  • 사전 훈련된 표현에서 유도된 비디오 기반 내재 보상으로 시각 기반 강화 학습에서 탐색을 향상시키기 위해.
  • 사전 훈련된 동역학 표현이 복잡하고 시각적으로 다를 수 있는 환경에서도 학습을 크게 가속화하고 성능을 향상시킬 수 있음을 입증하기 위해.

제안 방법

  • 다양하고 구조가 없는 비디오(예: RLBench에서의 비디오)의 대규모 컬렉션에서 동작에 의존하지 않는 잠재 비디오 예측 모델을 사전 훈련하여 일반화 가능한 동역학 표현을 학습하기 위해.
  • 사전 훈련된 동작에 의존하지 않는 모델과 새로운 동작 조건부 잠재 동역학 모델을 조합한 스택 구조를 도입하여, 이후 작업에 대한 미세 조정을 위해 사용하기 위해.
  • 사전 훈련된 인코더가 인덕티브 바이어스를 제공하도록, 세계 모델 기반 강화 학습 알고리즘(DreamerV2)을 사용하여 타겟 환경에서 스택 모델을 엔드 투 엔드로 미세 조정하기 위해.
  • 사전 훈련된 동작에 의존하지 않는 모델의 특징을 활용하여, 새로운 시각적 동역학을 보상하는 방식으로, 비디오 기반 내재 보상을 설계하기 위해.
  • 특히 동작 입력을 통합할 때 안정성을 확보하기 위해, 미세 조정 중에 기울기 클리핑과 학습률 웜업을 적용하기 위해.
  • 사전 훈련 단계에서 분리된 표현과 의미 있는 시각적 동역학 표현을 유도하기 위해 대비 기반 사전 훈련 목표를 사용하기 위해.

실험 결과

연구 질문

  • RQ1다양하고 구조가 없는 비디오에서 동작에 의존하지 않는 비지도 사전 훈련이 시각 기반 강화 학습에서 샘플 효율성과 최종 성능을 향상시키는가?
  • RQ2목표 도메인과 다른 시각적 분포와 작업 구조를 가진 소스 도메인(예: RLBench)의 비디오에서 사전 훈련을 수행하더라도, 여전히 전이 가능한 표현을 얻을 수 있는가?
  • RQ3스택 구조가 사전 훈련된 동작에 의존하지 않는 표현의 인덕티브 바이어스를 유지하면서, 미세 조정 단계에서 동작 입력을 효과적으로 통합할 수 있는가?
  • RQ4사전 훈련된 표현에서 파생된 비디오 기반 내재 보상이 시각 기반 강화 학습에서 탐색을 향상시키는가?
  • RQ5어려운 운동 제어 작업에서, 복잡한 시각적 관측을 가진 환경에서 사전 훈련이 학습 동역학에 어떤 영향을 미치는가?

주요 결과

  • APV는 Meta-World의 6개의 조작 작업에서 총합 95.4%의 성공률을 기록하여, DreamerV2가 기록한 67.9%보다 유의미하게 높은 성능을 보였다.
  • DeepMind Control Suite의 Quadruped 작업에서, APV는 사전 훈련과 내재 보상 모두를 적용했을 때, 기존의 DreamerV2를 초월했으며, 사전 훈련만으로도 충분히 높은 성능을 기록했다.
  • Hopper Hop 작업에서, APV는 사전 훈련과 내재 보상 모두를 적용했을 때, 학습 시작 단계부터 DreamerV2를 앞서는 성능을 기록하여, 더 나은 탐색과 샘플 효율성을 입증했다.
  • RLBench 비디오에서의 사전 훈련이 시각적 외관과 작업 구조의 큰 도메인 갭이 존재하는 Meta-World로의 효과적인 전이를 가능하게 했다.
  • 동작에 의존하지 않는 비디오 예측 모델은 RLBench와 Meta-World 비디오에서 의미 있는 동적 예측을 생성했으며, 로봇의 운동과 물체 상호작용을 잘 포착했고, Something-Something-V2에서는 흐릿한 예측을 보였다.
  • 절단 실험 결과, 사전 훈련이 유용한 동역학 표현을 학습하기 위해 필요한 환경 상호작용 수를 줄이는 강력한 인덕티브 바이어스를 제공하는 것으로 나타났으며, 특히 초기 학습 단계에서 두드러졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.