Skip to main content
QUICK REVIEW

[論文レビュー] RoboNet: Large-Scale Multi-Robot Learning

Sudeep Dasari, Frederik Ebert|Digital Eprints Services at ISB (DESI) (Indian School of Business)|Oct 24, 2019
Domain Adaptation and Few-Shot Learning参考文献 60被引用数 16
ひとこと要約

RoboNetは、7台のロボットプラットフォームから得た1,500万フレームのビデオフレームを含む大規模かつマルチロボットのデータセットを導入し、一般化可能な視覚ベースのロボット操作を可能にする。この多様なデータ上で視覚的予測モデルと逆モデルを事前学習することで、新しいロボット、物体、視点、グリッパーに対して、ゼロショットおよびファインチューニング性能が優れており、ロボット固有の学習に比べて4倍~20倍少ないデータ量で優る性能を達成した。

ABSTRACT

Robot learning has emerged as a promising tool for taming the complexity and diversity of the real world. Methods based on high-capacity models, such as deep networks, hold the promise of providing effective generalization to a wide range of open-world environments. However, these same methods typically require large amounts of diverse training data to generalize effectively. In contrast, most robotic learning experiments are small-scale, single-domain, and single-robot. This leads to a frequent tension in robotic learning: how can we learn generalizable robotic controllers without having to collect impractically large amounts of data for each separate experiment? In this paper, we propose RoboNet, an open database for sharing robotic experience, which provides an initial pool of 15 million video frames, from 7 different robot platforms, and study how it can be used to learn generalizable models for vision-based robotic manipulation. We combine the dataset with two different learning algorithms: visual foresight, which uses forward video prediction models, and supervised inverse models. Our experiments test the learned algorithms' ability to work across new objects, new tasks, new scenes, new camera viewpoints, new grippers, or even entirely new robots. In our final experiment, we find that by pre-training on RoboNet and fine-tuning on data from a held-out Franka or Kuka robot, we can exceed the performance of a robot-specific training approach that uses 4x-20x more data. For videos and data, see the project webpage: https://www.robonet.wiki/

研究の動機と目的

  • ロボットと環境をまたいで大規模なデータ共有を可能にすることで、ロボット学習におけるデータ効率性と一般化性能の限界を克服すること。
  • 実世界のロボット経験を容易に拡張可能な新規ハードウェアやセンサーに対応できる、スケーラブルで自己教師ありのデータ収集パイプラインの開発。
  • 事前学習されたモデルが、未確認のロボット、物体、視点、グリッパーに対して最小限のファインチューニングで一般化できるかどうかの評価。
  • 共有された大規模データセットからの転移学習が、大幅に少ないデータ量で伝統的なロボット固有の学習を上回ることの実証。

提案手法

  • Sawyer、Franka、Kuka、Baxter、WidowX、Fetch、Googleのロボットを含む7台のロボットプラットフォームを用いて、さまざまな物体、視点、環境で162,000の自律的トラジェクトリを収集。
  • 明示的な報酬やラベルを必要としない、自己教師ありで人為的介入を最小限に抑えたデータ収集プロトコルを用い、ビデオとアクションのシーケンスを収集。
  • アクション条件付きの動画予測を用いて世界のダイナミクスを学習し、目的に向かう計画を可能にする視覚的予測モデルの訓練。
  • 1枚の画像から別の画像に遷移するアクションを予測する深層逆モデルを訓練し、目的画像への到達を可能にする。
  • RoboNetデータセット全体でモデルを事前学習し、保留されたロボット(Franka や Kuka)から400トラジェクトリを用いてファインチューニングし、ゼロショットおよび少データ一般化性能を評価。
  • ゼロショットおよびファインチューニング設定を用いて、未確認の物体、新しい視点、新しいテーブル表面、新しいグリッパー、新しいロボットプラットフォームにおける一般化性能を評価。

実験結果

リサーチクエスチョン

  • RQ1大規模かつマルチロボットのデータセットで事前学習されたモデルは、追加の訓練なしに、新しいロボット、物体、環境に一般化できるか?
  • RQ2多様な実世界のロボットデータで事前学習することで、ロボット固有の学習に比べてデータの効率性が向上するか?
  • RQ3視覚的予測モデルと逆モデルは、異なるロボットハードウェア、カメラの視点、グリッパーの種別に対してどれほど一般化できるか?
  • RQ4新しいロボットプラットフォームに適応させるために、事前学習モデルが最小限のファインチューニングデータをどれほど必要とするか?
  • RQ5大規模な実世界データからの自己教師あり学習は、はるかに多くのデータを用いたドメイン特化学習を上回ることができるか?

主な発見

  • RoboNetで事前学習した後、400トラジェクトリのファインチューニングのみで、未確認のロボット(Franka や Kuka)に対しても一般化が可能となり、ロボット固有の学習に比べて4倍~20倍少ないデータ量で優れた性能を達成した。
  • RoboNetでファインチューニングされたモデルは、ゼロショットで新しい物体、新しい視点、新しいテーブル表面に対しても一般化でき、広範なドメイン一般化の能力を示した。
  • 5億パラメータの動画予測モデルですらRoboNetでアンダーフィッティングを示したため、現在のアーキテクチャでは、データセットの全多様性を十分に活用できないことが示された。
  • 結果から、大規模データからのパフォーマンス向上は、モデル容量とデータ分布の不一致によって制限されており、より柔軟なモデル設計や知的データ選択の必要性が浮き彫りになった。
  • 本研究では、機関間およびロボットプラットフォーム間でのデータ共有が実現可能で効果的であることを示した。数100のトラジェクトリのファインチューニングで、新しいハードウェアへの適応が十分に可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。