Skip to main content
QUICK REVIEW

[論文レビュー] Multi-View Masked World Models for Visual Robotic Manipulation

Younggyo Seo, Junsu Kim|arXiv (Cornell University)|Feb 5, 2023
Advanced Vision and Imaging被引用数 6
ひとこと要約

本稿では、多視点マスク付き自己符号化器を用いて多様なカメラアングルから強力な視覚的表現を学習する強化学習フレームワーク、Multi-View Masked World Models (MV-MWM) を提案する。この手法により、視覚的ロボット操作が効果的に行えるようになる。本手法は、多視点および単視点制御タスクで最先端の性能を達成し、カメラキャリブレーションを必要とせず現実世界への展開が可能であり、シミュレーションおよび現実世界の両方で視点のランダム化に対して強く頑健である。

ABSTRACT

Visual robotic manipulation research and applications often use multiple cameras, or views, to better perceive the world. How else can we utilize the richness of multi-view data? In this paper, we investigate how to learn good representations with multi-view data and utilize them for visual robotic manipulation. Specifically, we train a multi-view masked autoencoder which reconstructs pixels of randomly masked viewpoints and then learn a world model operating on the representations from the autoencoder. We demonstrate the effectiveness of our method in a range of scenarios, including multi-view control and single-view control with auxiliary cameras for representation learning. We also show that the multi-view masked autoencoder trained with multiple randomized viewpoints enables training a policy with strong viewpoint randomization and transferring the policy to solve real-robot tasks without camera calibration and an adaptation procedure. Video demonstrations are available at: https://sites.google.com/view/mv-mwm.

研究の動機と目的

  • ナチュラルな入力統合を超えた、視覚的ロボット操作に多視点視覚データを効果的に活用する表現学習手法の開発。
  • 視点不変性を仮定し、正例/負例ペairの注意深い選別を必要とする従来の対照的学習手法の限界の解消。
  • カメラキャリブレーションや適応処理を一切行わず、多視点表現学習のみを用いてシミュレーションから現実世界のロボットへの頑健なポリシー転送を実現すること。
  • 視点のランダム化が視覚サーボの頑健性を向上させる表現学習にどのように寄与するかの検証。
  • 多視点制御、補助視点を用いた単視点制御、視点に頑健な制御といった多様なロボット操作設定において、手法の有効性の評価。

提案手法

  • 視点(カメラビュー)全体をランダムにマスクし、全ビュー間の動画自己符号化を用いてマスクされた画素を再構築する多視点マスク付き自己符号化器を学習する。
  • 可変サイズの多視点入力を処理し、共有表現を抽出するためにビジョントランスフォーマーバックボーンを用いる。
  • 自己符号化器を固定し、固定された表現上でワールドモデルを学習して仮想軌道を生成し、モデルベース強化学習によるポリシー学習を実施する。
  • 多様でランダムに選択されたカメラ設定で学習することで、表現学習段階で視点のランダム化を適用する。
  • 補助カメラを備えた単視点制御設定において、学習済み表現を強化学習および行動クラーニングに活用する。
  • ランダムに選択された視点でシミュレーション内でポリシーを学習し、再トレーニングやキャリブレーションなしにそのまま現実世界のロボットに展開することで、シミュレーションから現実への転送を実現する。

実験結果

リサーチクエスチョン

  • RQ1ランダムな視点マスキングを伴う多視点マスク付き自己符号化は、視点内および視点間の情報を含む、視覚的制御に有用な表現を学習できるか?
  • RQ2提案手法は、多視点および単視点ロボット操作タスクにおいて、単視点および多視点対照的表現学習ベースラインを上回る性能を示すか?
  • RQ3視点に頑健な表現学習を用いて学習したポリシーは、カメラキャリブレーションやドメイン適応処理なしに現実世界のロボット操作に一般化可能か?
  • RQ4手で保持する、または振動するカメラなどの動的・不安定なカメラ設定に対しても、この手法は効果的に機能するか?
  • RQ5提案された表現学習方式は、強化学習および模倣学習の両設定において一貫して性能向上をもたらすか?

主な発見

  • MV-MWMは、RLBenchにおけるシミュレーション環境で、単視点表現学習ベースライン(例:ViT, MoCo, SimCLR)および多視点対照的ベースライン(Sermanet et al., 2018)をすべてのタスクで上回った。
  • 模倣学習において、MWMベースライン比で14.35パーセンテージポイントの向上を達成し、視点マスキングを用いた多視点表現学習の利点を示した。
  • MV-MWMは、カメラキャリブレーションや適応手順を一切行わず、現実世界のロボット操作タスクへのポリシーのシミュレーションから現実への転送に成功した。
  • 視点のランダム化を用いて学習したポリシーは、手で保持するカメラや不安定なカメラ設定に対しても、現実世界の条件に頑健に一般化され、強力な視覚サーボ性能を示した。
  • 視点マスキング方式そのものだけで、模倣学習において6.56パーセンテージポイント(57.92%から64.48%)の性能向上を達成し、表現学習における有効性を確認した。
  • 本フレームワークは、多視点制御、補助カメラを備えた単視点制御、視点に頑健な制御といった多様な設定をサポートしており、広範な適用可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。