Skip to main content
QUICK REVIEW

[論文レビュー] Zero-Shot Robot Manipulation from Passive Human Videos

Homanga Bharadhwaj, Abhinav Gupta|arXiv (Cornell University)|Feb 3, 2023
Human Pose and Action Recognition被引用数 6
ひとこと要約

本論文は、インターネット上の受動的ヒューマンビデオのみを用いて、微調整なしにロボット操作を実行するゼロショットフレームワークを提案する。モデルはシーン画像から妥当なヒューマンハンド軌道を予測し、それをロボットの行動にマッピングする。トレーニングにはウェブスケールのエゴセントリックビデオを用い、非条件付きタスクでは約40–60%、目的条件付きタスクでは約30–40%の成功を達成した。

ABSTRACT

Can we learn robot manipulation for everyday tasks, only by watching videos of humans doing arbitrary tasks in different unstructured settings? Unlike widely adopted strategies of learning task-specific behaviors or direct imitation of a human video, we develop a a framework for extracting agent-agnostic action representations from human videos, and then map it to the agent's embodiment during deployment. Our framework is based on predicting plausible human hand trajectories given an initial image of a scene. After training this prediction model on a diverse set of human videos from the internet, we deploy the trained model zero-shot for physical robot manipulation tasks, after appropriate transformations to the robot's embodiment. This simple strategy lets us solve coarse manipulation tasks like opening and closing drawers, pushing, and tool use, without access to any in-domain robot manipulation trajectories. Our real-world deployment results establish a strong baseline for action prediction information that can be acquired from diverse arbitrary videos of human activities, and be useful for zero-shot robotic manipulation in unseen scenes.

研究の動機と目的

  • インターネット上の非構造的で受動的なヒューマンビデオのみを用いて、ゼロショットロボット操作を可能にすること。
  • 多様なヒューマンオブジェクトインタラクション動画から、エージェントに依存しない行動表現を学習すること。
  • ドメイン内デモや微調整なしに、これらの表現を未確認の環境における物理的ロボットに転送すること。
  • ウェブ動画からの行動予測が、実世界の設定で信頼性のある操作を可能にするかどうかを評価すること。

提案手法

  • 1枚のシーン画像から2秒間の6次元ハンド軌道(パームセンターのポーズ)を確率的予測するモデルを訓練する。
  • Epic-Kitchensなどのデータセットから得られる多様なエゴセントリックビデオを用いて、軌道予測モデルを学習する。
  • ヒューマンハンド軌道からロボットエンドエフェクタ軌道への変換を運動学的マッピングにより実施する。
  • 逆運動学コントローラーを用いて予測された軌道を実行することで、実世界の設定でゼロショットでモデルをデプロイする。
  • 2つのバリエーションを開発する:非条件付き(妥当な行動を予測)と目的条件付き(指定された目的状態に到達する行動を予測)。
  • 目的モデルを、シーンの目的の最終状態を示す目的画像で条件づける。

実験結果

リサーチクエスチョン

  • RQ1受動的ヒューマンビデオから抽出した行動表現は、未確認の環境におけるゼロショットロボット操作に一般化可能か?
  • RQ2多様なインターネット動画で学習された単一の統合モデルは、物理的ロボットへのゼロショットデプロイにどの程度効果的か?
  • RQ3非条件付き行動予測と比較して、目的条件付きはゼロショットロボット操作の信頼性とタスク特異性を向上させるか?
  • RQ4ヒューマンビデオからロボット制御への軌道転送における主な失敗モードは何か?
  • RQ5非エキスパートで非構造的なヒューマンビデオで学習したモデルは、ラボ内データを一切用いずに、実世界の操作タスクで意味のある成功を達成できるか?

主な発見

  • 非条件付きモデルは、引き出しの開閉、押す、ボウルを動かすといった粗い操作タスクで40–60%の成功率を達成した。
  • 目的条件付きモデルは、ドアを完全に開ける、野菜を指定された場所に移動させるといった目的状態に到達するタスクで30–40%の成功率を達成した。
  • 目的条件付きモデルは、特定の構成に到達する際、非条件付きモデルよりも優れており、10回中4回が目的の引き出し状態に到達した(非条件付きモデルは10回中3回)。
  • 失敗分析の結果、非条件付きモデルの40%の失敗は誤った初期接触に起因し、60%は非現実的な運動(例:ドアを外側に引く)に起因していた。
  • 目的条件付きモデルでは、3番目の失敗モード(全失敗の40%)が観察された。これは、ロボットが妥当な行動を実行したが、目的が指定した行動ではなかった場合(例:間違った引き出しを開ける)に発生した。
  • 3D Scene Flowなどのベースラインと比較して、本モデルはデータが少ない場合に11%の成功率、全データを使用した場合に平均37%の成功率を達成し、大規模かつ多様なウェブ動画の価値を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。