Skip to main content
QUICK REVIEW

[論文レビュー] A Mobile Manipulation System for One-Shot Teaching of Complex Tasks in Homes

Max Bajracharya, James Borders|arXiv (Cornell University)|Sep 30, 2019
Robot Manipulation and Learning参考文献 43被引用数 4
ひとこと要約

本論文では、1回の仮想現実(VR)デモを通じて、事前のマップや物体モデルなしに、実際の家庭環境で複雑な人間レベルのタスクを学習できるモバイルマニピュレーションシステムを提示する。パラメータ化されたハイブリッド制御、シーン理解のための学習済み高密度ビジョナル埋め込み、およびタスクグラフアーキテクチャを組み合わせることで、1タスクあたり平均45の行動を含む60回のエンドツーエンドタスク実行において85%の成功率を達成し、事前のマップや物体モデルなしに環境の変化に対して頑健であることを示した。

ABSTRACT

We describe a mobile manipulation hardware and software system capable of autonomously performing complex human-level tasks in real homes, after being taught the task with a single demonstration from a person in virtual reality. This is enabled by a highly capable mobile manipulation robot, whole-body task space hybrid position/force control, teaching of parameterized primitives linked to a robust learned dense visual embeddings representation of the scene, and a task graph of the taught behaviors. We demonstrate the robustness of the approach by presenting results for performing a variety of tasks, under different environmental conditions, in multiple real homes. Our approach achieves 85% overall success rate on three tasks that consist of an average of 45 behaviors each.

研究の動機と目的

  • 事前の物体モデルやマップがなくても、非構造的な家庭環境で汎用的なモバイルマニピュレータが複雑で人間レベルのタスクを実行できるようにすること。
  • 仮想現実における1回の人のデモから新しいタスクを学習するシステムを開発し、新しいタスクのための工学的作業を最小限に抑えること。
  • 照明の変化、ごみ、物体の再配置などの自然な環境の変化に対しても、実際の家庭で頑健に実行できること。
  • 学習済みビジョナル埋め込みにより、認識と行動を分離することで、モジュラーで診断可能なタスク実行を可能にすること。
  • 最小限の人的介入と高い故障耐性を備えた実際の家庭でのエンドツーエンドタスク成功を実現すること。

提案手法

  • VRベースの教育を容易にするために、高いエンドエフェクタの操作性と広い視野角を持つ高機能なモバイルマニピュレータを使用する。
  • タスクは仮想現実で教える。ユーザーは、頑健性を確保し、パrameter調整を最小限に抑えるために、パラメータ化されたハイブリッド位置/力制御を用いて行動をデモする。
  • 教育時にキーフレームから抽出された、学習済みのピxls単位のビジョナル埋め込みを用いることで、実行時における視点の変化や照明の変化に対しても、シーンマッチングが頑健に可能になる。
  • 行動はビジョナル埋め込みに関連付けられ、エントリ条件と成功基準に基づくエグジット条件を持つ動的タスクグラフに統合され、行動の再利用と連結が可能になる。
  • グローバルマップを明示的に作成しないで、視覚キーフレームマッチングと反応型パスフォローリングに依存することで、ナビゲーションとマニピュレーションを実現する。
  • 故障検出と回復機構をタスクグラフに統合し、99.6%の行動で故障を検出し回復可能にし、テスト中に深刻な故障は観測されなかった。

実験結果

リサーチクエスチョン

  • RQ1事前の物体モデルやマップがなくても、モバイルマニピュレーションロボットが1回のVRデモで実際の家庭で複雑で多段階のタスクを学習できるか?
  • RQ2照明の変化、ごみ、物体の再配置などの自然な環境の変化に対して、このシステムはどの程度頑健か?
  • RQ3学習済みビジョナル埋め込みは、異なるシーン構成や視点でも正確な行動実行をどの程度可能にするか?
  • RQ4タスクグラフアーキテクチャは、複雑な複数行動タスクの実行中に、再利用と回復をどの程度効果的に可能にするか?
  • RQ5多様で非構造的な条件下において、実際の家庭でエンドツーエンドのタスク成功率はどの程度か?

主な発見

  • 本システムは、2つの実際の家庭で60回のエンドツーエンドタスク実行において、全体で85%の成功率を達成した。3つの複雑なタスクは1つあたり平均45の行動を含んでいた。
  • 照明の変化、追加の障害物、再配置された物体、キャビネットドアの状態変化(開いて、閉まって、一部開いて)に対しても、システムは顕著な頑健性を示した。
  • 行動の失敗は全体の0.4%にとどまり、主に物体の姿勢推定の不正確さや誤ったキーフレームマッチング(例:部分的に開いているキャビネットを閉じていると誤認する)に起因していた。
  • 故障検出と回復機構により、99.6%の行動が成功または回復可能であり、テスト中に深刻な故障は観測されなかった。
  • ロボットは人間より10〜100倍遅く動作した(平均20倍遅い)ため、パフォーマンス最適化の余地があることが示された。
  • 学習済みの高密度ビジョナル埋め込みの使用により、視点の変化やシーンのごみに対しても、明示的な物体認識やセグメンテーションが不要な状態で、信頼性の高い行動実行が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。