Skip to main content
QUICK REVIEW

[論文レビュー] Global Search with Bernoulli Alternation Kernel for Task-oriented Grasping Informed by Simulation

Rika Antonova, Mia Kokić|arXiv (Cornell University)|Oct 10, 2018
Robot Manipulation and Learning参考文献 31被引用数 10
ひとこと要約

本論文は、サンプル効率的でロバストなオンライン学習を実現するため、インフォームド(シミュレーションベース)とアンインフォームド(標準的)なカーネルを交互に切り替えるベイズ最適化のためのベルヌーイ交互カーネルを提案する。合成データで学習された深層ニューラルネットワークを用いて、グリップの安定性とタスク適合性を予測することで、シミュレーションと現実のギャップや物理的性質の高い不確実性にもかかわらず、スパoonやマグカップなどの挑戦的な物体に対しても、5回未満の試行で効果的なグリップを同定する。

ABSTRACT

We develop an approach that benefits from large simulated datasets and takes full advantage of the limited online data that is most relevant. We propose a variant of Bayesian optimization that alternates between using informed and uninformed kernels. With this Bernoulli Alternation Kernel we ensure that discrepancies between simulation and reality do not hinder adapting robot control policies online. The proposed approach is applied to a challenging real-world problem of task-oriented grasping with novel objects. Our further contribution is a neural network architecture and training pipeline that use experience from grasping objects in simulation to learn grasp stability scores. We learn task scores from a labeled dataset with a convolutional network, which is used to construct an informed kernel for our variant of Bayesian optimization. Experiments on an ABB Yumi robot with real sensor data demonstrate success of our approach, despite the challenge of fulfilling task requirements and high uncertainty over physical properties of objects.

研究の動機と目的

  • ロボットポリシー学習における高いシミュレーション-現実ギャップに起因する課題に対処すること、特に新規オブジェクトに対するタスク指向グリッピングにおいて。
  • 高精細シミュレータを仮定せずに、シミュレーションベースの事前知識を統合することで、オンラインロボット学習のサンプル効率を向上させること。
  • 滑らかでない、ノイズの多い現実世界のコスト関数に対しても、探索と活用のバランスを取るロバストな最適化フレームワークを開発すること。
  • ビジョンと合成データから学習されたタスク固有のスコアを用いて、リアルタイムかつデータ効率的なグリップポリシーの適応を可能とすること。
  • 高不確実性なオブジェクトの物理的性質を想定した状況下で、実際のABB Yumiロボットを用いて手法を検証すること。

提案手法

  • ベルヌーイ交互カーネルは、ベイズ最適化においてインフォームド(シミュレーションベース)とアンインフォームド(標準的)なカーネルを交互に切り替えることで、シミュレーション-現実ギャップへの感受性を低減する。
  • 大規模な合成データ上でトレーニングされた畳み込みニューラルネットワークは、生のRGB-D観測とオブジェクトメッシュから、グリップの安定性とタスク適合性スコアを予測する。
  • ネットワークの出力であるタスク指向グリップスコアは、ベイズ最適化のためのインフォームドカーネルを構築するために用いられ、有望なグリップ設定への探索を導く。
  • ビジョンパイプラインを用いて点群から3Dメッシュを生成し、オブジェクト表面にグリップ候補をサンプリングし、タスク固有の基準に基づいて低スコアの点をフィルタリングする。
  • 交互カーネルを用いたベイズ最適化は、アプローチ方向、方向、オフセットといったグリップパラメータのオンライン探索を実行し、現実世界のフィードバックを用いてポリシーを最適化する。
  • 獲得関数は探索と活用のバランスを取る。初期試行は、複数の安定性指標から上位の候補を用いて、劣悪な初期点を回避する。

実験結果

リサーチクエスチョン

  • RQ1インフォームドとアンインフォームドなカーネルを交互に切り替えるハイブリッドなベイズ最適化フレームワークは、ロボットポリシー学習におけるシミュレーション-現実ギャップの影響を効果的に低減できるか?
  • RQ2高精細シミュレータを必要とせず、シミュレーション生成データを用いてオンライン学習をタスク指向グリッピングに導く方法は何か?
  • RQ3合成データで学習した深層ニューラルネットワークは、新規の実物オブジェクトに対してタスクに適したグリップ設定をどの程度正確に予測できるか?
  • RQ4上位10個のオフライン候補が失敗した場合でも、本手法は10回未満の現実世界の試行で成功するタスク指向グリッピングを達成できるか?
  • RQ5オブジェクトの物理的性質に高い不確実性があり、ロボットの運動学的制約がある状況下で、本手法はどの程度の性能を示すか?

主な発見

  • ベルヌーイ交互カーネルにより、スパoon やマグカップといった挑戦的な実物オブジェクトに対し、成功したタスク指向グリッピングが達成され、上位10個のオフライン候補が失敗したにもかかわらず、4回の試行で成功した。
  • マグカップの手渡しタスクでは、4回目の試行で成功したが、そのグリップは上位10個の安定性やタスク適合性スコアに該当しないものであった。これは、静的ヒューリスティクスを超えた有効な探索を可能にしたことを示している。
  • パントラブルサポートタスクでは、5回目の試行で成功したが、上位10個のオフラインアプローチはすべりや傾きのため失敗していた。これは、動的でフィードバック駆動の探索の利点を示している。
  • 15回の実行のうち、6回は10回の試行を全行程完了し、9回は5回の試行後に早期終了したが、複数回の成功グリップが得られた。これは、極めて高いサンプル効率を示している。
  • 本手法は、小さなオブジェクトに対して近接衝突提案による計画失敗を効果的に回避したが、ナイフ、ペン、スクリューブラウザーのタスクでは、近接制約のため同様の失敗が発生した。
  • シミュレーションを活用したカーネルの使用により、オフライングリップ候補のみに依存するか、標準的BOに依存する場合と比較して、収束速度と成功率が著しく向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。