Skip to main content
QUICK REVIEW

[論文レビュー] Active model learning and diverse action sampling for task and motion planning

Zi Wang, Caelan Reed Garrett|arXiv (Cornell University)|Mar 2, 2018
Gaussian Processes and Bayesian Inference参考文献 24被引用数 5
ひとこと要約

本論文は、最小限の現実世界試行でセンサモータープリミティブ(注ぎ、かき混ぜるなど)を効率的に学習できる、アクティブモデル学習と多様なアクションサンプリングのフレームワークを提案する。ガウス過程回帰を用いてアクションの実行可能性をモデル化し、連続的空間におけるタスク・モーションプランニングと統合することで、ベースライン手法と比較して長時間スケジュールタスクにおける計画効率と成功確率を顕著に向上させる。

ABSTRACT

The objective of this work is to augment the basic abilities of a robot by learning to use new sensorimotor primitives to enable the solution of complex long-horizon problems. Solving long-horizon problems in complex domains requires flexible generative planning that can combine primitive abilities in novel combinations to solve problems as they arise in the world. In order to plan to combine primitive actions, we must have models of the preconditions and effects of those actions: under what circumstances will executing this primitive achieve some particular effect in the world? We use, and develop novel improvements on, state-of-the-art methods for active learning and sampling. We use Gaussian process methods for learning the conditions of operator effectiveness from small numbers of expensive training examples collected by experimentation on a robot. We develop adaptive sampling methods for generating diverse elements of continuous sets (such as robot configurations and object poses) during planning for solving a new task, so that planning is as efficient as possible. We demonstrate these methods in an integrated system, combining newly learned models with an efficient continuous-space robot task and motion planner to learn to solve long horizon problems more efficiently than was previously possible.

研究の動機と目的

  • 高価な現実世界試行を最小限に抑えて、ロボットが新しいセンサモータープリミティブを効率的に学習できるようにすること。
  • アクティブ学習とガウス過程を用いて、プリミティブアクションの事前条件と効果をモデル化すること。
  • 複雑で高次元の環境において計画の成功確率を向上させるために、多様で高カバレッジのアクションサンプルを生成すること。
  • 学習済みモデルを連続的空間におけるタスク・モーションプランナに統合し、長時間スケジュールタスクを解けるようにすること。
  • シミュレーテッドロボット操作タスクにおいて、計画の効率性と頑健性が向上することを実証すること。

提案手法

  • 与えられたアクション設定の成功確率を予測するスコア関数をモデル化するために、ガウス過程回帰を用いる。
  • 学習に最も情報量の多いアクション設定を選択するためにアクティブ学習を採用し、現実世界試行の回数を最小限に抑える。
  • 文脈パラメータに応じた多様で実行可能なアクションインスタンスを生成するための適応的サンプリング戦略を開発する。
  • ロボットと物体のポーズの間の関数的関係など、次元削減制約を尊重する条件付きサンプラーを導入する。
  • ガウス過程からの不確実性推定値を活用し、学習段階での情報収集と計画段階での成功確率推定の両方を支援する。
  • 学習済みモデルを連続的空間におけるタスク・モーションプランナであるSTRIPStreamに統合する。

実験結果

リサーチクエスチョン

  • RQ1センサモータープリミティブの実行可能性を学習するために、現実世界試行を最小限に抑えるにはどうすればよいか?
  • RQ2高次元の設定空間において、実行可能なアクションの空間をカバーする多様で効果的なアクションサンプルをどのように生成できるか?
  • RQ3成功確率と多様性の両方をバランスさせた適応的サンプリング戦略は、長時間スケジュールタスクにおいて一様またはランダムサンプリングを上回る性能を示せるか?
  • RQ4ガウス過程を用いたアクティブ学習は、ロボット操作タスクにおけるモデルの正確性と計画効率をどのように向上させるか?
  • RQ5学習済みのプリミティブの事前条件と効果のモデルは、複雑で現実世界に近い状況において、どの程度頑健で汎用的な計画を可能にするか?

主な発見

  • Task Iの1000通りの障害物配置において、多様なlkサンプリング法は、多様なgkおよびベースライン手法を上回る計画報酬を達成し、95%信頼区間で一貫した改善が確認された。
  • Task II(壁に近い場所での注ぎ)では、多様なlkが計画成功確率で他の手法を上回り、学習後の分散が低く、より高い安定性を示した。
  • Task III(ホルダーからカップをつかむ)では、複雑性が増したにもかかわらず、多様なlkは他のサンプリング戦略を上回る優れた性能を示し、計画成功確率が高かった。
  • Task IIおよびTask IIIの学習曲線には急激な転換点が見られ、カーネル長尺度の高いペナルティとテストセットサイズが限界(50タスク)であることが原因で、ハイパーパramータチューニングに敏感である可能性が示唆された。
  • 統合システムは、7つの既存の操作と2つの新たに学習したプリミティブ(注ぎ、すくい)を含む複雑なコーヒーサービスタスクを、対象物の配置が変化しても20〜40秒で正常に完了した。
  • システムは顕著な物体のずれに対しても頑健に耐えられ、現実世界に近い条件下での一般化性と適応性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。