Skip to main content
QUICK REVIEW

[論文レビュー] Robotic Telekinesis: Learning a Robotic Hand Imitator by Watching Humans on Youtube

Aravind Sivakumar, Kenneth Shaw|arXiv (Cornell University)|Feb 21, 2022
Human Pose and Action Recognition被引用数 5
ひとこと要約

本論文では、1台のキャリブレーション不要なRGBカメラのみを用いて、16自由度のロボットハンドおよびアームをリアルタイムで制御できる、低コストでグローブ不要・マーカー不要の遠隔操作システム「Robotic Telekinesis」を提案する。事前に収集されたYouTube動画を用いて3次元人体ポーズ推定器を事前学習し、敵対的自己衝突損失を備えた新規なモーションリターゲティングネットワークを活用することで、滑らかで自己衝突のない、意味的に正確な人間のハンド動作の模倣を実現。専用ハードウェアやキャリブレーションを必要とせず、訓練を受けていないユーザーでも、特別な準備なしに機敏な操作タスクを実行可能となる。

ABSTRACT

We build a system that enables any human to control a robot hand and arm, simply by demonstrating motions with their own hand. The robot observes the human operator via a single RGB camera and imitates their actions in real-time. Human hands and robot hands differ in shape, size, and joint structure, and performing this translation from a single uncalibrated camera is a highly underconstrained problem. Moreover, the retargeted trajectories must effectively execute tasks on a physical robot, which requires them to be temporally smooth and free of self-collisions. Our key insight is that while paired human-robot correspondence data is expensive to collect, the internet contains a massive corpus of rich and diverse human hand videos. We leverage this data to train a system that understands human hands and retargets a human video stream into a robot hand-arm trajectory that is smooth, swift, safe, and semantically similar to the guiding demonstration. We demonstrate that it enables previously untrained people to teleoperate a robot on various dexterous manipulation tasks. Our low-cost, glove-free, marker-free remote teleoperation system makes robot teaching more accessible and we hope that it can aid robots in learning to act autonomously in the real world. Videos at https://robotic-telekinesis.github.io/

研究の動機と目的

  • グローブやマーカー、専用ハードウェアを一切使用せずに、低コストかつリアルタイムで機敏なロボットハンドの遠隔操作を可能にすること。
  • 人間-ロボットポーズ対応のデータ不足問題を克服するため、大量でラベルなしのインターネット動画データを活用して事前学習すること。
  • 多様な人間のハンドポーズを、物理的に妥当で自己衝突のないロボットの軌道にリアルタイムに変換するモーションリターゲティングシステムを開発すること。
  • 訓練を受けていないユーザーが、単一のカメラで観測される自然なハンド動作のみを用いて、複雑な機敏な操作タスクを成功させられること。
  • 人間のデモンストレーションを直感的かつアクセス可能な形で提供することで、ロボット学習の民主化を図り、自律ポリシー学習の起動を可能にすること。

提案手法

  • 本システムは、1台のキャリブレーション不要なカメラで撮影された2次元RGB動画フレームから、事前に学習済みの3次元人体ポーズ推定器を用いて人間のハンドおよびボディポーズを推定する。
  • 新規なモーションリターゲティングネットワークが、エネルギーに基づく最適化フレームワークを用いて、推定された人間ポーズを16自由度のAllegroロボットハンドおよびアームの関節構成にマッピングする。
  • エネルギー関数には、キーポoinマッチング損失、キネマティック整合性損失、および敵対的自己衝突損失が含まれており、物理的妥当性を保証するとともに自己衝突を回避する。
  • 自己衝突損失は、予測されたロボットポーズが自己衝突を引き起こすかどうかを分類するディスクライマーを用いて学習され、暗黙の自己衝突回避を伴うエンドツーエンドの学習が可能となる。
  • システム全体は、収集されていない数千時間にわたるYouTube動画を用いて事前学習され、実験室でのロボットのアクティブなデータ収集が不要となる。
  • 1フレームあたり40msの推論予算を確保することで、リアルタイム推論が実現され、制御不能な環境下でも応答性の高い遠隔操作が可能となる。

実験結果

リサーチクエスチョン

  • RQ11台のRGBカメラと特別なハードウェアなしで、ロボットハンドをリアルタイムに遠隔操作できるか?
  • RQ2収集済みでないインターネット動画で学習したシステムが、訓練を受けていないユーザーによる現実世界の遠隔操作に一般化可能か?
  • RQ3明示的な衝突検出なしに、人間のハンドからロボットハンドへのモーションリターゲティング中に自己衝突を効果的に回避する方法は何か?
  • RQ4多様なYouTube動画を用いた事前学習が、遠隔操作ポリシーのロバスト性および一般化性能をどの程度向上させるか?
  • RQ5真のロボットデータが存在しない状況でも、学習されたリターゲティングネットワークがDexPilot-Monocular ∗のような強力なベースラインを上回れるか?

主な発見

  • 提案されたニューラルネットワークリターゲターは、擬似真値オラクルとの一致において、1関節あたり0.17ラジアン(約10°)のRMSEを達成し、DexPilot-Monocular ∗(0.25ラジアン、約14°)を上回った。
  • 敵対的自己衝突損失の導入により、ロボットハンドポーズにおける自己衝突が顕著に減少した一方で、人間デモンストレーションとの意味的類似性は維持された。
  • アブレーションスタディの結果、自己衝突の最小化とポーズの類似性の最小化の間にはトレードオフが存在し、自己衝突損失の重みを0.8に設定することで、良好なバランスが達成された。
  • 本システムにより、事前に訓練を受けていない10名の被験者が、自然なハンド動作と1台のカメラのみを用いて、10の挑戦的な機敏な操作タスクを成功させた。
  • 1フレームあたり40msの推論予算を確保したため、制御不能な環境下でも応答性があり滑らかな遠隔操作が実現された。
  • 非専門家を対象とした体系的なユーザースタディにより、本手法が多様なユーザーおよびタスクにわたり良好に一般化することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。