Skip to main content
QUICK REVIEW

[論文レビュー] Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation

Hongtao Wu, Ya Jing|arXiv (Cornell University)|Dec 20, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本論文では、マルチタスクで言語条件付きの視覚的ロボット操作を向上させるために、大規模な動画生成的事前学習を活用するGPT風のトランスフォーマー・モデルGR-1を提案する。動画予測で事前学習し、ロボットデータで微調整することで、CALVINベンチマークで94.9%の最先端の成功率を達成し、ゼロショットで未観測のシーンに一般化する際も85.4%の成功率を示し、未観測の物体や環境に対しても強力な一般化性能を示している。

ABSTRACT

Generative pre-trained models have demonstrated remarkable effectiveness in language and vision domains by learning useful representations. In this paper, we extend the scope of this effectiveness by showing that visual robot manipulation can significantly benefit from large-scale video generative pre-training. We introduce GR-1, a straightforward GPT-style model designed for multi-task language-conditioned visual robot manipulation. GR-1 takes as inputs a language instruction, a sequence of observation images, and a sequence of robot states. It predicts robot actions as well as future images in an end-to-end manner. Thanks to a flexible design, GR-1 can be seamlessly finetuned on robot data after pre-trained on a large-scale video dataset. We perform extensive experiments on the challenging CALVIN benchmark and a real robot. On CALVIN benchmark, our method outperforms state-of-the-art baseline methods and improves the success rate from 88.9% to 94.9%. In the setting of zero-shot unseen scene generalization, GR-1 improves the success rate from 53.3% to 85.4%. In real robot experiments, GR-1 also outperforms baseline methods and shows strong potentials in generalization to unseen scenes and objects. We provide inaugural evidence that a unified GPT-style transformer, augmented with large-scale video generative pre-training, exhibits remarkable generalization to multi-task visual robot manipulation. Project page: https://GR1-Manipulation.github.io

研究の動機と目的

  • 大規模な動画データを活用することで、視覚的ロボット操作におけるデータの効率性と一般化性能の課題に取り組む。
  • 統一的な事前学習と微調整の枠組みにより、ロボットデータのスパarsityと多様なモodalitiy(マルチモーダル性)を克服する。
  • シミュレーションおよび現実世界の両環境において、未観測のシーン、物体、言語指示に対し強力なゼロショット一般化を可能にする。
  • 1つのGPT風トランスフォーマーが動画生成的事前学習を通じてマルチタスク視覚的操作を効果的に学習できることを示す。
  • 動画予測事前学習が、複雑な現実世界のロボットタスクにおけるポリシーの一般化と耐性を向上させることを実証的根拠で示す。

提案手法

  • 言語指示、観測画像、ロボット状態を入力とするGPT風トランスフォーマーとしてGR-1を設計する。
  • 時間的・視覚的ダイナミクスを学習するために、動画予測目的を用いて大規模な動画データセットでGR-1を事前学習する。
  • ロボットデータ上でエンドツーエンドに微調整し、ロボットの行動と将来の観測フレームを両方予測する。
  • 事前学習と微調整の両方で統一されたアーキテクチャを採用することで、動画データからロボットポリシー学習へのスムーズな転送を実現する。
  • 自己回帰モデリングと互換性のある単一のシーケンス入力形式に、言語、画像、ロボット状態のマルチモーダル入力を統合する。
  • 動画予測信号を強力なインダクティブバイアスとして活用し、行動予測と一般化性能の向上を図る。
Figure 1: Overview of GR-1. GR-1 is first pre-trained on the task of video prediction with a large-scale video dataset. It is then finetuned on robot data to learn multi-task visual robot manipulation.
Figure 1: Overview of GR-1. GR-1 is first pre-trained on the task of video prediction with a large-scale video dataset. It is then finetuned on robot data to learn multi-task visual robot manipulation.

実験結果

リサーチクエスチョン

  • RQ1大規模な動画生成的事前学習は、マルチタスク視覚的ロボット操作におけるゼロショット一般化を改善できるか?
  • RQ2動画データで事前学習することで、ロボット操作における低データ量および未観測シーン設定での性能にどのような影響を与えるか?
  • RQ3統一的なGPT風トランスフォーマー・モデルが、多様な操作タスクと言語指示にどの程度一般化できるか?
  • RQ4動画予測事前学習は、現実世界の設定において、干渉要因や分布外のオブジェクトインスタンスに対し、耐性を高めるか?
  • RQ5成功率、一般化性能、データ効率の観点から、GR-1は最先端の手法と比べてどのように差をつけるか?

主な発見

  • CALVINベンチマークでは、GR-1は標準評価で88.9%(SOTAベースライン)から94.9%へ成功率を向上させた。
  • ゼロショット未観測シーン一般化では、GR-1は53.3%の最良ベースラインから85.4%の成功率を達成した。
  • 完全なロボットデータセットの10%のみを用いても、GR-1は77.8%の成功率を達成し、最良のベースラインの66.8%を上回った。
  • GR-1は未観測の物体インスタンスに対しても効果的に一般化し、アボカドやブロッコリーなど新しい野菜を運ぶタスクでも高い成功率を示した。
  • 最も挑戦的な未観測の物体カテゴリ設定においても、GR-1は強力な性能を維持したが、色の類似性から bell pepper と peach を誤認する場合がある(例:誤認識)。
  • 現実世界の実験では、GR-1はRT-1 や MT-R3M を上回り、物体搬送およびアーティファクト付きオブジェクト操作の両方で、シーンの攪乱や分布外条件に対しても耐性を示した。
Figure 2: Encoders and Decoders. (a) Language encoder. (b) Robot state encoder. (c) Image encoder. (d) Image decoder. (e) Action decoder.
Figure 2: Encoders and Decoders. (a) Language encoder. (b) Robot state encoder. (c) Image encoder. (d) Image decoder. (e) Action decoder.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。