Skip to main content
QUICK REVIEW

[論文レビュー] Towards Learning Efficient Maneuver Sets for Kinodynamic Motion Planning

Aravind Sivaramakrishnan, Zakary Littlefield|arXiv (Cornell University)|Jul 18, 2019
Robotic Path Planning Algorithms参考文献 7被引用数 4
ひとこと要約

本論文では、ニューラルネットワークを用いて生成された学習済みの行動セットを、Dijkstra-inspired Random Tree(DIRT)のような運動計画法に適用し、目的志向の探索(利用)と多様な方向への探索(拡散)のバランスを図ることで、運動計画の効率を向上させる手法を提案する。局所的な障害物情報とヒューリスティック情報から効果的な行動を予測するため、全結合型(FC)および畳み込み型(Conv)のネットワークを訓練し、解の探索時間とコストを削減する。特に、FC(All)モデルは、シミュレート環境において最も速い収束速度と最良の最終解の品質を達成した。

ABSTRACT

Planning for systems with dynamics is challenging as often there is no local planner available and the only primitive to explore the state space is forward propagation of controls. In this context, tree sampling-based planners have been developed, some of which achieve asymptotic optimality by propagating random controls during each iteration. While desirable for the analysis, random controls result in slow convergence to high quality trajectories in practice. This short position statement first argues that if a kinodynamic planner has access to local maneuvers that appropriately balance an exploitation-exploration trade-off, the planner's per iteration performance is significantly improved. Generating such maneuvers during planning can be achieved by curating a large sample of random controls. This is, however, computationally very expensive. If such maneuvers can be generated fast, the planner's performance will also improve as a function of computation time. Towards objective, this short position statement argues for the integration of modern machine learning frameworks with state-of-the-art, informed and asymptotically optimal kinodynamic planners. The proposed approach involves using using neural networks to infer local maneuvers for a robotic system with dynamics, which properly balance the above exploitation-exploration trade-off. In particular, a neural network architecture is proposed, which is trained to reflect the choices of an online curation process, given local obstacle and heuristic information. The planner uses these maneuvers to efficiently explore the underlying state space, while still maintaining desirable properties. Preliminary indications in simulated environments and systems are promising but also point to certain challenges that motivate further research in this direction.

研究の動機と目的

  • ランダムな制御サンプリングに代えて学習済みのインフォームド行動を用いることで、漸近的に最適な運動計画法の効率を向上させること。
  • 木ベースの計画法におけるランダム制御伝搬の遅さを解消し、学習済みの利用と探索のトレードオフを導入すること。
  • 局所状態情報(障害物とヒューリスティックガイダンス)から高品質な行動を推論するための機械学習パイプラインを構築すること。
  • 最新の計画法(例:DIRT)にニューラルネットワークを統合し、収束速度を向上させつつ漸近的最適性を保持すること。
  • 学習済み行動が、さまざまな環境下での初回解の速度と最終解の品質に与える影響を評価すること。

提案手法

  • 局所状態特徴(障害物マップとヒューリスティックマップ)から、1つの利用的行動と4つの拡散的行動からなる5行動のセットを予測するニューラルネットワークを訓練する。
  • DIRTプランナの実行中に、1,000個のランダム制御をオンラインでキュレートし、各状態における最適行動のラベル付きデータセットを生成する。
  • 全結合型(FC)と畳み込み型(Conv)の2種類のネットワークアーキテクチャを用い、局所的な空間的特徴から行動セットを予測する。
  • 予測された行動をDIRTプランナに統合し、木の拡張時に優先順位を付けることで、より速い収束を促進する。
  • 評価においては、ゴールまでのユークリッド距離をヒューリスティック関数、軌道の所要時間をコスト関数として用いる。
  • 2つの環境で訓練と評価を実施:ヒューリスティックガイダンスが有効な「グリーディ(Greedy)」設定と、グリーディ行動が失敗する「エクスプロア(Explore)」設定。

実験結果

リサーチクエスチョン

  • RQ1学習済み行動セットは、運動計画における解の発見に必要な反復回数を顕著に削減できるか?
  • RQ2ランダム制御を使用する計画法と比較して、学習済み行動を用いる計画法の解のコストと収束速度はどのように異なるか?
  • RQ3学習済みセットに利用的行動と拡散的行動の両方を含めることで、困難な環境下での計画法のロバスト性が向上するか?
  • RQ4異なるニューラルネットワークアーキテクチャ(FC対Conv)は、生成される行動の効率性と品質にどのように影響するか?
  • RQ5リアルタイム計画において、学習済み行動とランダム制御の間で、計算コストと衝突に関するトレードオフは何か?

主な発見

  • 『エクスプロア』環境において、DIRT-FC(All)モデルは最初の解を発見するまでの反復回数が最も少なく(1,876.67)、最終的な解のコストも最良(130.92)であった。
  • 『グリーディ』環境では、DIRT-FC(All)モデルは620反復で最初の解を発見し、最も低い最終コスト(45.47)を達成し、ランダム制御や単一モード予測を上回った。
  • 利用的行動のみを用いた場合(例:DIRT-FC(Exploit))は、『エクスプロア』環境で一部の実行で失敗したことが示され、十分な探索が行われていないことが判明した。
  • 全結合型ネットワークは、ランダム制御サンプリングよりも高速な推論を達成したが、GPU非搭載環境では畳み込み型ネットワークの方が遅かった。
  • 学習済み行動はロボットの効果的な誘導を可能にしたが、望ましいよりも多くの衝突を引き起こしたため、衝突回避パスを優先するための訓練の改善が求められる。
  • 現在のニューラルネットワーク推論コストは、ランダム制御サンプリングを上回っており、リアルタイムデプロイのためにはハードウェア加速またはモデル圧縮の導入が不可欠である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。