Skip to main content
QUICK REVIEW

[논문 리뷰] Robot Learning with Sensorimotor Pre-training

Ilija Radosavovic, Baifeng Shi|arXiv (Cornell University)|2023. 06. 16.
Robot Manipulation and Learning인용 수 4
한 줄 요약

이 논문은 실제 로봇 궤적에서 시각, 운동감각, 동작 토큰의 마스킹된 시퀀스를 예측하기 위해 트랜스포머 모델을 사용하는 자기지도 학습 센서모터 사전학습 방법 RPT를 제안한다. 이 방법은 랜덤 초기화로 학습하는 것에 비해 일관된 성능 향상을 이끌어내며, 블록 쌓기 작업에서 최대 2배의 성능 향상을 기록하고, 레이블이 없는 센서모터 데이터만으로 다양한 작업, 환경, 로봇 간 효과적인 전이를 가능하게 한다.

ABSTRACT

We present a self-supervised sensorimotor pre-training approach for robotics. Our model, called RPT, is a Transformer that operates on sequences of sensorimotor tokens. Given a sequence of camera images, proprioceptive robot states, and actions, we encode the sequence into tokens, mask out a subset, and train a model to predict the missing content from the rest. We hypothesize that if a robot can predict the masked-out content it will have acquired a good model of the physical world that can enable it to act. RPT is designed to operate on latent visual representations which makes prediction tractable, enables scaling to larger models, and allows fast inference on a real robot. To evaluate our approach, we collected a dataset of 20,000 real-world trajectories over 9 months using a combination of motion planning and grasping algorithms. We find that sensorimotor pre-training consistently outperforms training from scratch, has favorable scaling properties, and enables transfer across different tasks, environments, and robots.

연구 동기 및 목표

  • 비라벨된 실제 세계 로봇 궤적에서 풍부한 센서모터 표현을 학습할 수 있는 자기지도 사전학습 방법을 개발하는 것.
  • 센서모터 시퀀스의 마스킹 예측이 하위 작업의 로봇 제어에 유용한 월드 모델을 제공할 수 있는지 조사하는 것.
  • 단일 사전학습 표현을 사용하여 다양한 작업, 환경, 로봇 간 전이 학습을 가능하게 하는 것.
  • 대규모 모델과 긴 컨텍스트 길이로 사전학습을 수행하면서도 실제 물리적 로봇에서 실시간 추론을 유지하는 것.

제안 방법

  • 모델인 RPT는 로봇 궤적에서 유도된 시각, 운동감각, 동작 토큰의 교차 배열 시퀀스를 처리하는 트랜스포머이다.
  • 시간과 모odal 간에 고비율의 다중모달 마스킹 전략을 적용하여, 모델이 나머지 컨텍스트에서 누락된 토큰을 예측하도록 한다.
  • 시각적 특징은 ImageNet에서 사전학습된 시각 인코더를 사용하여 추출하며, 잠재 표현을 활용함으로써 예측의 계산 가능성과 확장성을 확보한다.
  • 마스킹된 토큰 예측에 대해 평균 제곱오차(MSE) 손실을 사용하여 사전학습함으로써, 시공간적 및 다중모달 간의 종속성을 학습하도록 유도한다.
  • 사전학습 이후, 피킹앤플레이스, 스태킹, 바인 퍼킹과 같은 하위 작업에서 학습된 표현을 미세조정한다.
  • 시각 계산과 시퀀스 모델링을 분리함으로써, 실제 로봇에서 300M+ 파라미터의 대규모 모델을 사용해도 10Hz 제어를 구현할 수 있다.

실험 결과

연구 질문

  • RQ1원시 센서모터 시퀀스에 대한 자기지도 마스킹 예측이 로봇 제어 정책 학습에 유용한 월드 모델을 학습시킬 수 있는가?
  • RQ2사전학습을 통해 실제 세계 궤적에서 학습하면, 무작위 초기화로 학습하는 것에 비해 샘플 효율성과 다양한 작업 및 로봇 간 일반화 능력이 향상되는가?
  • RQ3모델 크기, 컨텍스트 길이, 데이터셋 크기 등의 스케일링 요소가 사전학습된 로봇 정책의 성능에 어떤 영향을 미치는가?
  • RQ4시각, 운동감각, 동작 간의 다중모달 마스킹이 단일모달 또는 희박한 마스킹보다 더 효과적인가?
  • RQ5사전학습된 표현이 다양한 로봇 플랫폼과 환경 간에 효과적으로 전이 가능한가?

주요 결과

  • RPT는 평가된 모든 작업에서 랜덤 초기화로 학습하는 것보다 일관되게 뛰어난 성능을 보이며, 더 복잡한 작업일수록 성능 향상이 커진다.
  • 블록 쌓기 작업에서 사전학습된 표현을 사용할 경우, 랜덤 초기화 대비 최대 2배의 성능 향상을 기록한다.
  • 사전학습은 다양한 작업 간 제로샷 전이를 성공적으로 가능하게 하며, 예를 들어 피킹앤플레이스에서 스태킹 및 바인 퍼킹으로의 정책 전이가 가능하다.
  • 이 방법은 유리한 스케일링 성질을 보이며, 더 큰 시각 인코더, 더 긴 컨텍스트 길이, 더 큰 사전학습 데이터셋을 사용할수록 성능 향상이 이루어진다.
  • 시간과 모달 간에 고비율의 다중모달 마스킹은 뛰어난 성능을 내며, 희박하거나 단일모달 마스킹 전략보다 뛰어나다.
  • 잠재 시각 표현의 사용은 실제 로봇에서 대규모 모델(300M+ 파라미터)을 사용해도 실시간 추론(10Hz)을 가능하게 하여, 실세계 적용에 실용적인 접근법을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.