[論文レビュー] Robot Learning with Sensorimotor Pre-training
本論文は、実世界の軌道から視覚的・本体感覚的・行動トークンのマスクされたシーケンスを予測するTransformerモデルを用いて、ロボティクスにおける自己教師ありセンサモータープレトレーニング手法RPTを提案する。この手法は、スクラッチからの学習と比較して一貫した性能向上を達成しており、ブロックスタッキングでは最大2倍の改善が得られ、ラベルなしセンサモーターデータのみを用いても、さまざまなタスク、環境、ロボット間での効果的な転移を可能にする。
We present a self-supervised sensorimotor pre-training approach for robotics. Our model, called RPT, is a Transformer that operates on sequences of sensorimotor tokens. Given a sequence of camera images, proprioceptive robot states, and actions, we encode the sequence into tokens, mask out a subset, and train a model to predict the missing content from the rest. We hypothesize that if a robot can predict the masked-out content it will have acquired a good model of the physical world that can enable it to act. RPT is designed to operate on latent visual representations which makes prediction tractable, enables scaling to larger models, and allows fast inference on a real robot. To evaluate our approach, we collected a dataset of 20,000 real-world trajectories over 9 months using a combination of motion planning and grasping algorithms. We find that sensorimotor pre-training consistently outperforms training from scratch, has favorable scaling properties, and enables transfer across different tasks, environments, and robots.
研究の動機と目的
- ラベルなし実世界のロボット軌道から豊かなセンサモーターリプリゼンテーションを学ぶ自己教師ありプレトレーニング手法の開発。
- センサモーターシーケンスのマスク予測が、下流のロボット制御に有用なワールドモデルを学習できるかどうかの検証。
- 一つのプレトレーニング表現を用いて、多様なタスク、環境、ロボット間での転移学習を可能にする。
- 大規模モデルおよび長いコンテキスト長にまでスケーリング可能なプレトレーニングを実現するとともに、実機ロボットでのリアルタイム推論を維持する。
提案手法
- モデルRPTは、ロボット軌道からの視覚的・本体感覚的・行動トークンを交互に処理するTransformerである。
- 時間的・モodal 様式にわたる高比率のマルチモーダルマスキング戦略を適用し、残りのコンテキストから欠落したトークンを予測する。
- 視覚特徴はImageNetで事前学習されたビジョンエンコーダーを用いて抽出され、潜在表現を用いることで予測の実行可能性とスケーラビリティを向上させる。
- マスクされたトークン予測に平均二乗誤差(MSE)損失を用いてプレトレーニングし、空間的・時間的およびクロスモーダルな依存関係の学習を促進する。
- プレトレーニング後、ピックアンドプレース、スタッキング、ビンピッキングなどの下流タスクで学習済み表現をファインチューニングする。
- 視覚計算とシーケンスモデリングを分離することで、実機ロボット上で300Mパラメータ以上の大きなモデルでも10 Hzの制御が可能になる。
実験結果
リサーチクエスチョン
- RQ1生のセンサモーターシーケンスに対する自己教師ありマスク予測は、ロボットポリシー学習に有用なワールドモデルを学習できるか?
- RQ2スクラッチからの学習と比較して、実世界の軌道でのプレトレーニングは、タスクやロボット間でのサンプル効率性および一般化性能を向上させるか?
- RQ3モデルサイズ、コンテキスト長、データセットサイズといったスケーリング要因が、プレトレーニング済みロボットポリシーの性能に与える影響は何か?
- RQ4視覚、本体感覚、行動の3モodal にわたるマルチモーダルマスキングは、単一モーダルまたはスパースマスキングと比較してより効果的か?
- RQ5プレトレーニング済み表現は、異なるロボットプラットフォームや環境間で効果的に転移可能か?
主な発見
- RPTは、評価されたすべてのタスクでスクラッチからの学習を上回り、より複雑なタスクになるほど性能向上が顕著に見られる。
- ブロックスタッキングタスクでは、プレトレーニング済み表現を用いることで、ランダム初期化と比較して最大2倍の性能向上が達成された。
- プレトレーニングにより、ピックアンドプレースからスタッキングやビンピッキングへのポリシーのゼロショット転移が成功した。
- 本手法は良好なスケーリング特性を示しており、より大きなビジョンエンコーダー、より長いコンテキスト長、より大きなプレトレーニングデータセットを用いることで性能が向上する。
- 時間的およびモーダルにわたる高比率のマルチモーダルマスキングが、性能向上に不可欠であり、スパースまたは単一モーダルマスキング戦略を上回る。
- 潜在的視覚表現の使用により、実機ロボット上で300Mパラメータを超える大きなモデルでもリアルタイム推論(10 Hz)が可能となり、実世界への展開に実用的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。