Skip to main content
QUICK REVIEW

[論文レビュー] Robobarista: Learning to Manipulate Novel Objects via Deep Multimodal Embedding

Jaeyong Sung, Seok Hyun Jin|arXiv (Cornell University)|Jan 12, 2016
Robot Manipulation and Learning参考文献 9被引用数 13
ひとこと要約

本稿では、3次元点群、自然言語の指示、軌道を共有埋め込み空間に統合することで、同様の部品を有する異なる物体間で操作戦略を転移できる、深層マルチモーダル埋め込みモデルであるRobobaristaを提案する。このモデルにより、エスプレッソマシンなど、事前に接触のない未確認の家電製品に対してもゼロショット転移が可能となり、成功裏に実行が達成された。

ABSTRACT

There is a large variety of objects and appliances in human environments, such as stoves, coffee dispensers, juice extractors, and so on. It is challenging for a roboticist to program a robot for each of these object types and for each of their instantiations. In this work, we present a novel approach to manipulation planning based on the idea that many household objects share similarly-operated object parts. We formulate the manipulation planning as a structured prediction problem and learn to transfer manipulation strategy across different objects by embedding point-cloud, natural language, and manipulation trajectory data into a shared embedding space using a deep neural network. In order to learn semantically meaningful spaces throughout our network, we introduce a method for pre-training its lower layers for multimodal feature embedding and a method for fine-tuning this embedding space using a loss-based margin. In order to collect a large number of manipulation demonstrations for different objects, we develop a new crowd-sourcing platform called Robobarista. We test our model on our dataset consisting of 116 objects and appliances with 249 parts along with 250 language instructions, for which there are 1225 crowd-sourced manipulation demonstrations. We further show that our robot with our model can even prepare a cup of a latte with appliances it has never seen before.

研究の動機と目的

  • ロボットがこれまでに経験したことのない新しい物体に対して、操作スキルを一般化できるようにすること。
  • 個々の家庭用家電機器ごとに手動でプログラミングするというスケーラビリティの課題に対処すること。
  • 視覚、言語、運動データの間で共通の意味的意味を持つ表現を学習し、物体間の操作転移を可能にすること。
  • 新規のクラウドソーシングプラットフォームを用いて、大規模かつ多様な操作デモンストレーションのデータセットを収集すること。
  • 共有埋め込み空間内での最近傍探索を用いた効率的な推論を可能にすること。

提案手法

  • 3次元点群、自然言語の指示、操作軌道を共通の潜在空間に埋め込むように、深層ニューラルネットワークを学習する。
  • 下位層は、単一モodalデータ上で自己教師あり手法を用いて事前学習され、強力なマルチモーダル特徴を学習する。
  • 微調整の段階で、損失に基づくマージンを導入し、意味的に類似した(点群、言語、軌道)三つ組を近づけ、類似しないものを遠ざける。
  • モデルは、最近傍探索に基づく構造的予測フレームワークを採用しており、新しい入力に対して埋め込み空間内での最近傍を予測軌道として選択する。
  • ロボット操作デモンストレーションをウェブ上で非専門家が記録できる新規のクラウドソーシングプラットフォーム「Robobarista」を提供し、116台の物体の249部品に対して合計1225件のデモンストレーションを収集した。
  • 軌道は、部品中心の座標フレームで表現され、同じ部品(例:ハンドル、レバー)を有する異なる物体間での転送を可能にする。

実験結果

リサーチクエスチョン

  • RQ1共通の部品レベルの機能的特性に基づいて、既知の物体から未確認の物体へ操作戦略を転移できるか?
  • RQ2視覚、言語、運動データを統合的に共有空間に埋め込むことで、マルチモーダルな操作スキル転移を実現できるか?
  • RQ3事前学習とマージンに基づく微調整を施した深層ニューラルネットワークが、ゼロショット一般化を可能にする意味的意味のある埋め込み空間を学習できるか?
  • RQ4クラウドソーシングプラットフォームは、このようなモデルの学習に適した多様で高品質な操作デモンストレーションを収集するのにどの程度効果的か?
  • RQ5異なる物体タイプから転送された軌道が、新しい未確認の家電機器でどの程度成功裏に実行可能か?

主な発見

  • モデルは、まったく異なる物体(例:スイッチからエスプレッソマシン)間で操作軌道を転送し、再訓練なしにPR2ロボット上で成功裏に実行した。
  • ロボットは、一度も見たことのないエスプレッソマシンを用いてラテを淹れる作業を実行し、未確認の家電機器に対するゼロショット一般化を実証した。
  • 収集した116台の物体と249部品、1225件のクラウドソーシングデモンストレーションを含むデータセットにおいて、すべてのベースライン手法を上回る性能を示した。
  • ネットワークの下位層を事前学習することで、標準的な事前学習手法と比較して性能が著しく向上した。
  • 微調整段階で損失を補正するマージンを導入したことで、より意味的意味を持つ埋め込み空間が得られ、ゼロショット転送の正確性が向上した。
  • 学習済み埋め込み空間のt-SNE可視化では、類似した点群と言語指示が明確にクラスタリングされており、効果的な意味的整合性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。