[論文レビュー] Learning compositional models of robot skills for task and motion planning
本稿では、アクティブラーニングとガウス過程を用いて、柔軟で一般化可能なタスクおよびモーションプランニングを可能にする、コンpositionalなロボットスキルのモデルを学習するフレームワークを提案する。少数の現実世界のデモからスキルの事前条件および効果をモデル化し、連続空間のプランナと統合することで、多様な現実世界およびシミュレーテッド環境における、コーヒーの淹れ方などの複雑で長時間にわたる操作タスクの堅牢な実行を達成する。
The objective of this work is to augment the basic abilities of a robot by learning to use sensorimotor primitives to solve complex long-horizon manipulation problems. This requires flexible generative planning that can combine primitive abilities in novel combinations and thus generalize across a wide variety of problems. In order to plan with primitive actions, we must have models of the actions: under what circumstances will executing this primitive successfully achieve some particular effect in the world? We use, and develop novel improvements on, state-of-the-art methods for active learning and sampling. We use Gaussian process methods for learning the constraints on skill effectiveness from small numbers of expensive-to-collect training examples. Additionally, we develop efficient adaptive sampling methods for generating a comprehensive and diverse sequence of continuous candidate control parameter values (such as pouring waypoints for a cup) during planning. These values become end-effector goals for traditional motion planners that then solve for a full robot motion that performs the skill. By using learning and planning methods in conjunction, we take advantage of the strengths of each and plan for a wide variety of complex dynamic manipulation tasks. We demonstrate our approach in an integrated system, combining traditional robotics primitives with our newly learned models using an efficient robot task and motion planner. We evaluate our approach both in simulation and in the real world through measuring the quality of the selected primitive actions. Finally, we apply our integrated system to a variety of long-horizon simulated and real-world manipulation problems.
研究の動機と目的
- 少数の現実世界の試行からの効率的なセンサモータスキルの学習を可能にし、データ収集コストを最小限に抑える。
- 連続的制御パラメータの関数として、スキルの事前条件および効果を確率的関数として捉えるモデルを開発する。
- 学習済みのスキルモデルをタスクおよびモーションプランニングフレームワークに統合し、新たな効果的なアクションシーケンスを組み立てる。
- 高精細シミュレーションを必要とせずに、物体の配置や遮蔽などの環境変動に対して堅牢性を確保する。
- 学習済みのスキルと既存のロボットプリミティブを統一されたプランニングパイプラインで組み合わせることで、多様なタスクインスタンスにおける一般化を達成する。
提案手法
- 少数の収集にコストがかかる現実世界のデモに基づいて、連続的制御パラメータ(例:注ぎのウェイポイント)の関数としてスキルの成功確率をガウス過程回帰でモデル化する。
- 探索と活用のバランスを取るために、多様性に基づく-lkおよび多様性に基づく-gkという適応的サンプリング戦略を用いたアクティブラーニングを実装する。
- サンプラーの性能を評価するために、$ J_k( heta) = \ extstyle extstyle\sum_{n=1}^\infty s(\theta,n)\gamma^n $ という割引プランニング報酬指標を適用する。ここで $ s(\theta,n) $ は $ n $ 番目のサンプルが計画生成に寄与したかどうかを示す。
- 離散的タスクプランニングと連続的パラメータ最適化を統合するPDDLストリームベースのプランナに学習済みスキルモデルを統合する。
- 運動プランナを用いて、学習済みスキルモデルから得られるサンプル済みエンドエフェクターゴールから、衝突のないロボット軌道を生成する。
- カーネルに基づく適応的サンプリングを活用し、観測された多様性とプランニングフィードバックに基づいて、動的に探索を調整することで、効果的な制御方策への収束を向上させる。
実験結果
リサーチクエスチョン
- RQ1少数の現実世界の試行からの効率的学習において、制御パラメータの有効な値の範囲を完全に捉えるにはどうすればよいか?
- RQ2複雑な環境におけるスキル実行のための連続的制御パラメータの探索を最も効果的に行うには、どのようなサンプリング戦略が適しているか?
- RQ3学習済みスキルモデルを既存のロボットプリミティブと組み合わせることで、多様で摂動を受ける環境においても、長時間にわたる高レベルの操作タスクを解けるか?
- RQ4一様または固定サンプリング戦略と比較して、適応的で多様性駆動のサンプリング戦略は、計画成功度およびサンプル効率の観点でどの程度優れているか?
- RQ5高精細シミュレーションに依存せずに、現実世界のロボットが新たな物体配置にどの程度一般化できるか?
主な発見
- 多様性に基づく-lkサンプリング戦略は、すべての評価タスク(プッシュ、注ぎ、複雑なコーヒーの淹れ方)において、ベースライン手法よりも高い計画報酬と低い分散を達成した。
- タスクI(テーブルから押し出す)では、多様性に基づく-lkが数回の反復後に最適なサンプリング戦略(左/右側へのサンプリング)に収束し、固定カーネルベースラインを上回った。
- タスクII(壁に近いカップでの注ぎ)では、多様性に基づく-lkが複雑な障害物配置下でも安定した成功率を示し、他のサンプラーと比較して分散が低かった。
- タスクIII(正確なグリップを要するホルダー内のカップ)では、多様性に基づく-lkが高次元の制約に対しても堅牢であったため、本手法が複雑な事前条件を処理できる能力を示した。
- 統合システムは、多様な物体配置下でコーヒーの淹れタスクを20〜40秒で実行でき、シミュレーションおよび現実世界実行の両方でリアルタイム実行可能性と一般化能力を示した。
- 再トレーニングを必要とせずに、顕著な物体の摂動に対してもシステムは正常に動作したため、学習済みモデルの環境変動に対する堅牢性が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。