Skip to main content
QUICK REVIEW

[論文レビュー] Do What I Want, Not What I Did: Imitation of Skills by Planning Sequences of Actions

Chris Paxton, Felix Jonathan|arXiv (Cornell University)|Dec 5, 2016
Robot Manipulation and Learning参考文献 27被引用数 4
ひとこと要約

本論文では、熟練者の模倣による高水準な行動を学習し、サンプリングベースの計画法を用いて新環境においても頑健で柔軟な行動シーケンスを生成する、タスク・アンド・モーション計画フレームワークを提案する。行動を運動特徴上の確率分布としてモデル化し、シンボリックなタスク計画と統合することで、シミュレーションおよび実世界の実験(UR5ロボットを用いて)において、正確で障害物を考慮した組立作業を実現した。

ABSTRACT

We propose a learning-from-demonstration approach for grounding actions from expert data and an algorithm for using these actions to perform a task in new environments. Our approach is based on an application of sampling-based motion planning to search through the tree of discrete, high-level actions constructed from a symbolic representation of a task. Recursive sampling-based planning is used to explore the space of possible continuous-space instantiations of these actions. We demonstrate the utility of our approach with a magnetic structure assembly task, showing that the robot can intelligently select a sequence of actions in different parts of the workspace and in the presence of obstacles. This approach can better adapt to new environments by selecting the correct high-level actions for the particular environment while taking human preferences into account.

研究の動機と目的

  • 障害物や変化する物体配置がある新環境において、ロボットが模倣されたスキルを一般化できるようにすること。
  • 高水準な行動を学習した運動分布に根ざさせることで、シンボリックなタスク計画と連続的モーション計画を統合すること。
  • 人間の好みとリアルタイムの環境制約を組み込むことで、計画の信頼性と柔軟性を向上させること。
  • UR5ロボットを用いた実世界の磁気構造組立タスクにおいて、提案手法を検証すること。

提案手法

  • 熟練者の模倣によるデータから学習された運動特徴(例:相対的位置・姿勢)の確率分布として行動をモデル化する。
  • 環境制約を尊重しながら、シンボリックな行動の連続的空間における実装を探索する再帰的サンプリングベースのモーションプランナを用いる。
  • 重要度サンプリングとクロスエントロピー法を用いて、新たな制約(例:障害物)を満たしつつも、事前知識を保持するように行動分布を再推定する。
  • シンボリックな状態間の遷移確率を離散分布としてモデル化し、計画中の行動選択をガイドする。
  • 学習済みの行動モデルと遷移モデルを組み合わせたプロダクトモデルを用いて、複数の妥当な解を有する複数ステップのタスク計画を可能にする。
  • 計画中に、教示された行動からの逸脱を最小限に抑えつつ、新たな環境制約を満たす行動シーケンスを選択する。

実験結果

リサーチクエスチョン

  • RQ1ロボットは、障害物や変化する物体の姿勢がある新環境において、模倣された行動をどのように一般化できるか?
  • RQ2模倣から学習した確率的行動モデルは、新規シナリオにおける信頼性の高い、適応的なタスク計画をサポートできるか?
  • RQ3先読みと行動オプションを統合することで、計画の質と成功確率はどのように向上するか?
  • RQ4人間の好みと環境制約を、学習済みの行動モデルにどの程度組み込むことができるか?

主な発見

  • オプションと先読みを備えた完全なアルゴリズムは、シミュレーションで配置誤差が1 cm未満に抑えられ、高いマッチング精度を示した。
  • 障害物のない環境では、完全なアルゴリズムは100%の成功率を達成し、熟練者データで学習した場合にのみ0件の失敗、追加のロボット生成データを用いた場合も0件の失敗を記録した。
  • 先読みやオプションがなければ、成功確率が著しく低下し、熟練者データのみで学習した場合に7件の失敗、追加のロボット生成データを用いた場合に3件の失敗が発生した。
  • 実世界の実験では、新しい構成に適応し、アライメント状態と障害物の有無に基づいて、どのオブジェクト(リンクかノードか)をつかむかを正しく選択した。
  • 追加の模倣データを用いることで性能が向上し、ベースラインと比較して完全なアルゴリズムはより柔軟で信頼性が高かった。
  • 計画は、教示された行動の好みに一致する代替で実行可能な軌道を選択することで、障害物を回避した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。