[논문 리뷰] Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation
이 논문은 다중 작업, 언어 조건부 시각적 로봇 조작을 향상시키기 위해 대규모 영상 생성 미사전학습을 활용하는 GPT 스타일 트랜스포머 모델인 GR-1을 제안한다. 영상 예측에서 사전학습하고 로봇 데이터에서 미세조정함으로써, GR-1은 CALVIN 벤치마크에서 94.9%의 최고 성공률과 제로샷 unseen 시나리오 일반화에서 85.4%의 성공률을 달성하여, 새로운 물체와 환경로의 강력한 일반화 능력을 입증한다.
Generative pre-trained models have demonstrated remarkable effectiveness in language and vision domains by learning useful representations. In this paper, we extend the scope of this effectiveness by showing that visual robot manipulation can significantly benefit from large-scale video generative pre-training. We introduce GR-1, a straightforward GPT-style model designed for multi-task language-conditioned visual robot manipulation. GR-1 takes as inputs a language instruction, a sequence of observation images, and a sequence of robot states. It predicts robot actions as well as future images in an end-to-end manner. Thanks to a flexible design, GR-1 can be seamlessly finetuned on robot data after pre-trained on a large-scale video dataset. We perform extensive experiments on the challenging CALVIN benchmark and a real robot. On CALVIN benchmark, our method outperforms state-of-the-art baseline methods and improves the success rate from 88.9% to 94.9%. In the setting of zero-shot unseen scene generalization, GR-1 improves the success rate from 53.3% to 85.4%. In real robot experiments, GR-1 also outperforms baseline methods and shows strong potentials in generalization to unseen scenes and objects. We provide inaugural evidence that a unified GPT-style transformer, augmented with large-scale video generative pre-training, exhibits remarkable generalization to multi-task visual robot manipulation. Project page: https://GR1-Manipulation.github.io
연구 동기 및 목표
- 대규모 영상 데이터를 활용하여 시각적 로봇 조작에서 샘플 효율성과 일반화 능력을 향상시키는 데 도전한다.
- 통합된 사전학습 및 미세조정 파라다임을 통해 로봇 데이터의 희소성과 다중 모odal 성격을 극복한다.
- 모의 환경과 실제 세계 설정 모두에서 새로운 시나리오, 물체, 언어 지시어에 대해 강력한 제로샷 일반화를 가능하게 한다.
- 단일 GPT 스타일 트랜스포머가 영상 생성 사전학습을 통해 다중 작업 시각적 조작을 효과적으로 학습할 수 있음을 보여준다.
- 영상 예측 사전학습이 복잡한 실제 세계 로봇 작업에서 정책의 일반화 능력과 강건성을 향상시킨다는 경험적 증거를 제공한다.
제안 방법
- 언어 지시어, 관찰 이미지, 로봇 상태를 입력으로 사용하는 GPT 스타일 트랜스포머인 GR-1을 설계한다.
- 시간적 및 시각적 동역학을 학습하기 위해 영상 예측 목표를 사용해 대규모 영상 데이터셋에서 GR-1을 사전학습한다.
- 로봇 데이터에서 엔드 투 엔드로 미세조정하여 향후 관찰 프레임과 로봇 동작을 모두 예측하도록 한다.
- 사전학습과 미세조정 모두에 동일한 아키텍처를 사용하여 영상 데이터에서 로봇 정책 학습으로의 원활한 전이를 가능하게 한다.
- 자기연쇄 모델링에 적합한 단일 시퀀스 입력 형식으로 다중 모달 입력(언어, 이미지, 로봇 상태)을 통합한다.
- 행동 예측과 일반화를 향상시키기 위해 영상 예측 신호를 강력한 인덕티브 바이어스로 활용한다.

실험 결과
연구 질문
- RQ1대규모 영상 생성 사전학습이 다중 작업 시각적 로봇 조작에서 제로샷 일반화를 향상시키는가?
- RQ2영상 데이터에서의 사전학습이 로봇 조작에서 저자료 및 unseen 시나리오 설정에서의 성능에 어떤 영향을 미치는가?
- RQ3통합된 GPT 스타일 트랜스포머 모델이 다양한 조작 작업과 언어 지시어에 얼마나 잘 일반화되는가?
- RQ4영상 예측 사전학습이 실제 세계 설정에서 간섭 요소와 분포 외 물체 인스턴스에 대해 강건성을 향상시키는가?
- RQ5성공률, 일반화 능력, 샘플 효율성 측면에서 GR-1은 최신 기술 대비 어떻게 비교되는가?
주요 결과
- CALVIN 벤치마크에서 GR-1은 표준 평가에서 기존 최고 성능 기준(88.9%)에서 94.9%로 성공률을 향상시켰다.
- 제로샷 unseen 시나리오 일반화에서는 기존 최고 성능 기준(53.3%)에서 85.4%의 성공률을 달성했다.
- 전체 로봇 데이터셋의 10%만으로도 GR-1은 77.8%의 성공률을 기록했으며, 기존 최고 성능 기준(66.8%)을 초월했다.
- GR-1은 새로운 물체 인스턴스에 효과적으로 일반화되어, 가지, 브로콜리와 같은 새로운 야채를 운반하는 데에도 높은 성공률을 기록했다.
- 가장 도전적인 설정인 unseen 물체 카테고리에서도 GR-1은 강력한 성능을 유지하지만, 색상 유사성으로 인해 편지와 편지( bell pepper와 peach)를 혼동하는 경우가 간헐적으로 발생한다.
- 실제 실험에서는 GR-1이 RT-1과 MT-R3M를 모두 압도하며 물체 운반과 구조물 조작 작업에서 뛰어난 성능을 보였으며, 시나리오 방해 요소와 분포 외 조건에 대해서도 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.