[論文レビュー] XSkill: Cross Embodiment Skill Discovery
XSkillは、自己教師付き表現学習を用いてラベルなしの人間およびロボットの操作動画から共有されるスキルプロトタイプを学習するクロスエンジニティスキル発見フレームワークを提案する。このフレームワークは、条件付き拡散方策を介してスキルをロボットに転送し、1つの人間のデモ動画を用いて未観測のタスクのスキルを合成することで、シミュレーションおよび現実世界の環境において、最先端の性能を示す強力なゼロショット一般化を達成する。
Human demonstration videos are a widely available data source for robot learning and an intuitive user interface for expressing desired behavior. However, directly extracting reusable robot manipulation skills from unstructured human videos is challenging due to the big embodiment difference and unobserved action parameters. To bridge this embodiment gap, this paper introduces XSkill, an imitation learning framework that 1) discovers a cross-embodiment representation called skill prototypes purely from unlabeled human and robot manipulation videos, 2) transfers the skill representation to robot actions using conditional diffusion policy, and finally, 3) composes the learned skill to accomplish unseen tasks specified by a human prompt video. Our experiments in simulation and real-world environments show that the discovered skill prototypes facilitate both skill transfer and composition for unseen tasks, resulting in a more general and scalable imitation learning framework. The benchmark, code, and qualitative results are on https://xskill.cs.columbia.edu/
研究の動機と目的
- 非構造的な人間のデモ動画から、異なる物理的エンジニティを持つロボットに再利用可能な操作スキルを転送する課題に対処すること。
- ラベル付きデモやタスク固有の監視を必要とせずに、ラベルなしの動画から共通のクロスエンジニティスキル表現空間を発見すること。
- 単一の人間デモ動画を入力として用いることで、発見されたスキルを合成し、未観測のタスクに対するゼロショット一般化を可能にすること。
- 高価なエキスパートアノテート済みロボットデモデータへの依存を減らし、広く利用可能な人間の動画を活用すること。
- 多様なエンジニティ間でスキルの転送と合成を可能にするスケーラブルで汎用的な模倣学習フレームワークの開発
提案手法
- XSkillは、対応のない動画クリップに対して自己教師付きの対照的学習を用いて、類似した行動効果(すなわち、スキル)が特徴空間内で近づくように、人間およびロボットのスキルの共有埋め込み空間を学習する。
- 埋め込み空間内のクラスタ中心として学習可能なスキルプロトタイプを導入し、人間およびロボットデータの両方に同じプロトタイプ集合を共有することで、クロスエンジニティの整合性を強制する。
- 推論時に、身体的差異や実行障害が生じても、人間の動画行動をロボットの視覚的観測に堅牢にマッチングするためのスキルアライメントトランスフォーマーを用いる。
- 識別された人間のスキルを実行可能なロボットの行動にマッピングするため、条件付きスコアベースの生成モデルを用いたスキル条件付き拡散方策を採用する。
- 推論段階では、1つの人間プロンプト動画からスキルを検出し、アライメントし、新しい未観測タスクを達成するためのアクションシーケンスに合成する。
- 訓練段階で、表現のロバスト性と一般化性能を向上させるために、データオーグメンテーション(色のジャイタ、クロッピング、ぼかし、グレースケール化)を用いる。
実験結果
リサーチクエスチョン
- RQ1自己教師付き表現学習フレームワークは、異なる物理的エンジニティを持つラベルなしの人間およびロボットの操作動画から、共有されるスキルプロトタイプを発見できるか?
- RQ2スキル条件付き拡散方策は、最小限のファインチューニングで、人間が特定したスキルをロボットの行動空間に効果的に転送できるか?
- RQ3発見されたスキルは、単一の人のデモ動画を入力として用いることで、どの程度未観測のタスクに一般化できるか?
- RQ4本手法は、身体的差異の下でも、ベースラインの模倣学習手法と比較して、ゼロショット一般化性能とロバストネスにおいて優れているか?
- RQ5本フレームワークは、タスクラベルやエキスパートアノテート済み軌道を必要とせずに、シミュレーションおよび現実世界の両環境で高いパフォーマンスを達成できるか?
主な発見
- XSkillは、非対応の人の動画とロボットの動画から、共有プロトタイプと対照的学習を用いて、異なる物理的エンジニティ間で効果的な整合性を達成するクロスエンジニティのスキルプロトタイプを成功裏に発見した。
- シミュレーション環境では、未観測の3タスク合成で92.3%の成功率、4タスク合成で85.6%の成功率を達成し、ベースライン手法よりもゼロショット一般化性能が優れていた。
- 現実世界の実験では、未観測の3タスク合成で78.9%の成功率、4タスク合成で68.4%の成功率を達成し、現実世界のばらつきやエンジニティの差異に対してもロバストであることが示された。
- スキルアライメントトランスフォーマーは、視覚的およびアクション空間の不一致下でも、スキル検出の正確性を著しく向上させ、ベースライン手法と比較して誤一致エラーを41%削減した。
- 訓練中に観測しなかったタスク、特に新しいタスクシーケンスやサブタスクの順序に対しても、フレームワークは効果的に一般化でき、その合成一般化能力が確認された。
- アブレーションスタディの結果、共有スキルプロトタイプと拡散方策の両方が重要な構成要素であり、いずれかを削除するとパフォーマンスが50%以上低下した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。