Skip to main content
QUICK REVIEW

[논문 리뷰] RoboCLIP: One Demonstration is Enough to Learn Robot Policies

Sumedh Sontakke, Jesse Zhang|arXiv (Cornell University)|2023. 10. 11.
Reinforcement Learning in Robotics인용 수 7
한 줄 요약

RoboCLIP는 사전 훈련된 영상 및 언어 모델(VLM)을 사용해 수동 보상 설계 없이 보상 신호를 생성함으로써, 단일 영상 또는 텍스트 시연로부터 로봇 정책 학습을 가능하게 하는 새로운 이민 학습 방법이다. 이는 로봇 조작 작업에서 최신 기술 대비 2–3배 높은 제로샷 성공률를 달성하며, 특히 도메인 외 시범 또는 VLM 미세조정 없이도 성능을 유지한다.

ABSTRACT

Reward specification is a notoriously difficult problem in reinforcement learning, requiring extensive expert supervision to design robust reward functions. Imitation learning (IL) methods attempt to circumvent these problems by utilizing expert demonstrations but typically require a large number of in-domain expert demonstrations. Inspired by advances in the field of Video-and-Language Models (VLMs), we present RoboCLIP, an online imitation learning method that uses a single demonstration (overcoming the large data requirement) in the form of a video demonstration or a textual description of the task to generate rewards without manual reward function design. Additionally, RoboCLIP can also utilize out-of-domain demonstrations, like videos of humans solving the task for reward generation, circumventing the need to have the same demonstration and deployment domains. RoboCLIP utilizes pretrained VLMs without any finetuning for reward generation. Reinforcement learning agents trained with RoboCLIP rewards demonstrate 2-3 times higher zero-shot performance than competing imitation learning methods on downstream robot manipulation tasks, doing so using only one video/text demonstration.

연구 동기 및 목표

  • 대규모 시범 데이터에 의존하는 강화학습에서 희박하고 비용이 많이 드는 전문가 지도 학습 문제를 해결하기 위해, 큰 규모의 시범 데이터에 대한 의존도를 줄이기 위해.
  • 데이터 효율성을 향상시키기 위해, 영상 또는 자연어 기반 기술 설명 중 하나의 시범만으로도 이민 학습을 가능하게 하기 위해.
  • 다른 도메인의 시범(예: 다른 환경에서 찍은 인간 영상)을 사용하여 보상 신호 생성을 가능하게 하기 위해.
  • 로봇 환경에 대해 VLM를 미세조정하지 않고도 사전 훈련된 VLM를 활용하여 온라인 RL에 대한 의미 기반 유사도 보상 생성을 위해.
  • 최소한의 인간 제공 지도 정보를 바탕으로 로봇 조작 작업에서의 제로샷 일반화 성능을 향상시키기 위해.

제안 방법

  • RoboCLIP는 HowTo100M에서 유래한 사전 훈련된 S3D 영상 모델을 사용하여 에이전트의 상호작용 영상과 작업 시범(텍스트 또는 영상)을 잠재 표현으로 인코딩한다.
  • 에이전트의 롤아웃과 시범의 잠재 표현 간 코사인 유사도를 계산하여 궤도 수준의 보상 신호를 생성하며, 이는 작업 성공의 대체 지표로 기능한다.
  • 이 방법은 온라인 RL 루프에서 작동하며, 에이전트가 탐색을 수행하고 VLM가 시범와의 일치도에 기반한 고밀도 의미 보상 신호를 제공한다.
  • VLM는 제로샷 방식으로 사용되며, 로봇 환경에 대해 미세조정을 수행하지 않아 도메인 간 일반화를 유지한다.
  • 이 방법은 도메인 내 및 도메인 외 시범(예: 다른 환경의 인간 영상 포함) 모두를 지원한다.
  • 대비 학습을 통해 VLM가 운동 및 의미적 구조를 포착함으로써 작업 완료 신호에 핵심적인 역할을 한다.
Figure 1 : RoboCLIP Overview. A Pretrained Video-and-Language Model is used to generate rewards via the similarity score between the encoding of an episode of interaction of an agent in its environment, $\mathbf{z}^{v}$ with the encoding of a task specifier $\mathbf{z}^{d}$ such as a textual descrip
Figure 1 : RoboCLIP Overview. A Pretrained Video-and-Language Model is used to generate rewards via the similarity score between the encoding of an episode of interaction of an agent in its environment, $\mathbf{z}^{v}$ with the encoding of a task specifier $\mathbf{z}^{d}$ such as a textual descrip

실험 결과

연구 질문

  • RQ1사전 훈련된 VLM를 사용해 보상 신호를 생성할 때, 단일 영상 또는 텍스트 시범만으로도 로봇 정책 학습이 가능한가?
  • RQ2다른 도메인의 시범(예: 다른 환경에서 찍은 인간 영상)을 사용해도 정책 학습에 효과적인 보상 신호를 제공할 수 있는가?
  • RQ3RoboCLIP의 성능은 제로샷 성공률 측면에서 최신 기술 대비 어떻게 비교되는가?
  • RQ4영상 기반 VLM를 사용하는 것과 정적 이미지 모델(예: CLIP)을 사용하는 것 간의 보상 품질 및 정책 성능에 어떤 영향을 미치는가?
  • RQ5VLM의 의미적 표현은 주어진 환경와의 도메인 이동(예: 주방 환경와 VLM의 사전 훈련 데이터 간의 이동)에 대해 일반화 가능한가?

주요 결과

  • RoboCLIP는 Meta-World 및 Franka Kitchen 환경에서 최신 기술 대비 2–3배 높은 제로샷 작업 성공률를 달성한다.
  • 도메인 내 단일 영상 시범은 더 강력한 사전 훈련 신호를 제공하며, 잠재 표현 정렬이 더 잘 되어 있어 다수의 시범보다 성능이 뛰어나다.
  • 도메인 외 인간 시범 영상조차도 환경나 카메라 설정이 사전 훈련 데이터와 다를지라도 유용한 보상 신호를 제공한다.
  • CLIP(정적 이미지로 훈련된 비전 트랜스포머)를 사용할 경우 유용한 사전 훈련 보상 신호를 제공하지 못함을 확인하여, 운동 및 시간적 동적 특성이 효과적인 보상 형상화에 필수적임을 입증한다.
  • 다양하고 비로봇 영상으로 사전 훈련된 VLM를 사용함에도 불구하고, 도메인 간 일반화가 잘 이루어져 있음을 확인할 수 있으며, 이는 강력한 성능을 유지함을 의미한다.
  • VLM의 미세조정 없이도 보상 신호가 안정적이고 효과적이므로, 제로샷 이민 학습에 적합한 사전 훈련된 표현의 견고성을 입증한다.
Figure 2 : Domain Alignment Confusion Matrix. We perform a confusion matrix analysis on a subset of the data on collected on Metaworld (Yu et al., 2020 ) environments by comparing the pair-wise similarities between the latent vectors of the strings describing the videos and those of the videos. We f
Figure 2 : Domain Alignment Confusion Matrix. We perform a confusion matrix analysis on a subset of the data on collected on Metaworld (Yu et al., 2020 ) environments by comparing the pair-wise similarities between the latent vectors of the strings describing the videos and those of the videos. We f

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.