Skip to main content
QUICK REVIEW

[論文レビュー] Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots

Cheng Chi, Zhenjia Xu|arXiv (Cornell University)|Feb 15, 2024
Modular Robots and Swarm Intelligence被引用数 4
ひとこと要約

UMIは、ゴーゴープロカメラ(155°の魚眼レンズ)とIMUを装備したハンドヘルドグリッパーと、視覚的文脈を向上させるためのサイドミラーを備えた、ポータブルで低コストなフレームワークを導入し、実世界の人の動きをそのままロボットの実行可能ポリシーに直接移行可能にします。遅延マッチド推論、相対軌道行動表現、およびディフュージョンポリシーを採用することで、複数のロボットプラットフォーム上で、多様で動的で両手を使った長時間のタスクにおいてゼロショット一般化を達成しています。

ABSTRACT

We present Universal Manipulation Interface (UMI) -- a data collection and policy learning framework that allows direct skill transfer from in-the-wild human demonstrations to deployable robot policies. UMI employs hand-held grippers coupled with careful interface design to enable portable, low-cost, and information-rich data collection for challenging bimanual and dynamic manipulation demonstrations. To facilitate deployable policy learning, UMI incorporates a carefully designed policy interface with inference-time latency matching and a relative-trajectory action representation. The resulting learned policies are hardware-agnostic and deployable across multiple robot platforms. Equipped with these features, UMI framework unlocks new robot manipulation capabilities, allowing zero-shot generalizable dynamic, bimanual, precise, and long-horizon behaviors, by only changing the training data for each task. We demonstrate UMI's versatility and efficacy with comprehensive real-world experiments, where policies learned via UMI zero-shot generalize to novel environments and objects when trained on diverse human demonstrations. UMI's hardware and software system is open-sourced at https://umi-gripper.github.io.

研究の動機と目的

  • 実世界の複雑な人間の操作スキルを、実世界のロボットハードウェアを必要とせずにロボットに移行する課題に対処すること。
  • 従来のハンドヘルドグリッパー・システムの限界、例えば不十分な視覚的情報、行動の不正確さ、遅延の不一致、不十分なポリシー表現を克服すること。
  • 非専門家が使用可能な低コストで直感的なインターフェースを用いて、スケーラブルで分散型のデータ収集を可能にすること。
  • 新しい環境や物体に対してもゼロショットで一般化可能な、ハードウェアに依存しないポリシー学習フレームワークを開発すること。

提案手法

  • ゴーゴープロカメラ(155°魚眼レンズ)とサイドミラーを装備したハンドヘルドグリッパーを用い、視覚的情報を強化し、暗黙的なステレオトラッキングを可能にします。
  • ゴーゴープロのIMUと独自開発のSLAMシステムを活用して、単眼動画からスケールの曖昧さや運動ブラーの影響を低減した6自由度の正確な軌道を回復します。
  • 推論時の遅延マッチングを実装し、ポリシー推論時のリアルタイムシステムの遅延と記録済みのデモの遅延を一致させます。
  • 絶対位置ではなく相対軌道として行動を表現することで、ポリシー学習をグローバル座標の正確さから分離します。
  • 多様な人間のデモに内在するマルチモーダルな行動分布をモデル化するために、ディフュージョンポリシーを適用します。
  • 運動学的妥当性をフィルタリングすることで、実機ロボットへのポリシーの後続デプロイメントを保証します。

実験結果

リサーチクエスチョン

  • RQ1センサが最小限の低コストでポータブルなハンドヘルドグリッパー・システムが、複雑な操作タスクの高精度な行動回復を可能にするか?
  • RQ2デモと推論の間の遅延不一致をどのように緩和することで、リアルタイムデプロイメントにおけるポリシーの頑健性を確保できるか?
  • RQ3絶対位置回帰と比較して、相対軌道行動表現がポリシーの一般化をどの程度向上させるか?
  • RQ4多様な実世界の人のデモで学習した単一のポリシー・アーキテクチャが、未確認の物体や環境に対してもゼロショット一般化を達成できるか?
  • RQ5広角魚眼レンズとサイドミラーが提供する視覚的情報が、行動回復の正確性とポリシー性能をどの程度向上させるか?

主な発見

  • UMIのSLAMシステムは、位置に関して6.1 mmの平均絶対軌道誤差(ATE)と、回転に関して3.5°を達成し、2台のグリッパー間の相対姿勢誤差は10.1 mmと0.8°でした。
  • カップ配置タスクでは、UMIのデータ収集は遠隔操作の3倍以上速く、人間の手の速度の48%に達しました。
  • 動的投げ込みタスクでは、UMIは人間の手の速度の64%を達成しましたが、遠隔操作は15分間で1回の成功デモも得られませんでした。
  • UMIで学習したポリシーは、再トレーニングなしに、未確認の物体やレイアウトを含む新しい環境や物体に対してもゼロショット一般化を達成しました。
  • このフレームワークにより、人間のデモデータのみで、両手を使ったセーターたたみ、動的物体投げ込み、正確な食器洗いといった複雑な行動のデプロイメントが可能になりました。
  • UMIのデータ収集はスケーラブルでアクセス可能であり、すべてのデータが1つのMP4ファイルに保存されており、地理的に分散した非専門家の参加が可能になっています。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。