Skip to main content
QUICK REVIEW

[論文レビュー] Motion Policy Networks

Adam Fishman, Adithyavairan Murali|arXiv (Cornell University)|Oct 21, 2022
Human Pose and Action Recognition被引用数 6
ひとこと要約

モーションポリシー・ネットワーク(Mπ ネット)は、生の深度ポイントクラウド観測から直接、衝突がなく滑らかなロボットアームの運動を生成するエンド・ツー・エンドのディープラーニングモデルである。50万のシミュレーテッド環境で300万の運動計画問題を学習したMπ ネットは、従来のニューラルプランナーより46%高い成功確率を達成しており、グローバルプランナーよりもはるかに高速で、現実世界のセンサーノイズに対しても頑健である。

ABSTRACT

Collision-free motion generation in unknown environments is a core building block for robot manipulation. Generating such motions is challenging due to multiple objectives; not only should the solutions be optimal, the motion generator itself must be fast enough for real-time performance and reliable enough for practical deployment. A wide variety of methods have been proposed ranging from local controllers to global planners, often being combined to offset their shortcomings. We present an end-to-end neural model called Motion Policy Networks (M$π$Nets) to generate collision-free, smooth motion from just a single depth camera observation. M$π$Nets are trained on over 3 million motion planning problems in over 500,000 environments. Our experiments show that M$π$Nets are significantly faster than global planners while exhibiting the reactivity needed to deal with dynamic scenes. They are 46% better than prior neural planners and more robust than local control policies. Despite being only trained in simulation, M$π$Nets transfer well to the real robot with noisy partial point clouds. Code and data are publicly available at https://mpinets.github.io.

研究の動機と目的

  • 生の深度センサ入力のみを用いて、未知の環境において高速で滑らかで衝突のないロボットの運動を生成する課題に対処すること。
  • 従来のプランナーやローカルコントローラーの限界を克服すること。これらはいずれも処理が遅く、反応性に欠けたり、複雑な幾何形状では失敗する。
  • 明示的なシーン表現や事前学習済みの衝突モデルを必要とせず、生の観測からエンド・ツー・エンドの学習を可能にすること。
  • 大規模なシミュレーション訓練を通じて、動的でノイズの多い現実世界の設定における一般化性能と頑健性を向上させること。
  • ドメインシフトを最小限に抑えて、シミュレーションおよび現実世界でのデプロイメントにおいて高い性能を達成すること。

提案手法

  • Mπ ネットは、50万の多様な環境にまたがる300万の運動計画問題の大量な合成データセット上でエンド・ツー・エンドに訓練されている。
  • モデルは1つの深度ポイントクラウドを入力とし、タスク空間における滑らかで衝突のないエンドエフェクタ軌道のシーケンスを出力する。
  • ネットワークアーキテクチャは、リアクティブで微分可能であるように設計されており、インスツルメンタル学習によるリアルタイム推論と訓練を可能にしている。
  • 訓練では、テスト時における完全なシーン幾何構造の入手が不可能であっても、ハイブリッドプランナーやグローバルプランナからのデモンストレーションを用いて運動ポリシー学習を監視する。
  • 安全で自然な運動を保証するため、軌道損失、衝突ペナルティ、滑らかさ正則化の組み合わせを用いてモデルを最適化する。
  • ドメインランダマイゼーションと部分的でノイズのあるポイントクラウドを用いた訓練により、現実のセンサ条件を模倣し、シミュレーションから現実への転送を可能にしている。

実験結果

リサーチクエスチョン

  • RQ1明示的なシーン再構築なしに、生の深度ポイントクラウドから直接、衝突がなく滑らかな運動を生成できるエンド・ツー・エンドのニューラルポリシーは学習可能か?
  • RQ2Mπ ネットの性能は、グローバルプランナーやローカル制御ポリシーと比較して、成功確率、速度、頑健性の観点でどのように異なるか?
  • RQ3完全にシミュレーションで訓練されたモデルが、ノイズが多く部分的な観測を持つ現実世界のロボット操作にどの程度一般化可能か?
  • RQ4多様なシミュレーテッド環境からの大規模なインスツルメンタル学習は、未確認の複雑な環境における一般化性能と成功確率を向上させるか?
  • RQ5推論時に外部プランナーや衝突チェック処理に依存する従来のニューラルプランナーよりも、Mπ ネットが優れているか?

主な発見

  • Mπ ネットは、テスト時に完全なシーン幾何構造を必要としない複雑な運動計画ベンチマークで、従来のニューラルプランナー(例:MPNets)よりも46%高い成功確率を達成した。
  • グローバルプランナーよりも100倍以上高速で、実時間推論速度を達成し、デプロイメントに適している。
  • テーブルトップ問題において、Mπ ネットはターゲットから1cm以内に到達する成功率が95.67%であり、同じ設定でSTORM(88.67%)とG. Fabrics(85.83%)を上回った。
  • 失敗モード解析において、Mπ ネットは最も挑戦的な問題において、自己衝突が0.5%、ジョイント違反が0.0%にとどまり、高い安全性と信頼性を示した。
  • 部分的でノイズのあるポイントクラウドからの深度センサ入力のみを用いても、シミュレーションから現実のロボットへの転送に成功し、実世界への一般化が良好である。
  • ドレッサー問題において、Mπ ネットはグローバルプランナが解ける問題で96.83%の成功率を達成し、STORM(53.83%)とG. Fabrics(62.33%)を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。