Skip to main content
QUICK REVIEW

[論文レビュー] End-to-End Motion Planning of Quadrotors Using Deep Reinforcement Learning

Efe Camci, Erdal Kayacan|arXiv (Cornell University)|Sep 30, 2019
Robotic Path Planning Algorithms参考文献 19被引用数 12
ひとこと要約

本稿では、深層強化学習を用いて、生の深度画像と相対的位置を直接運動プリミティブにマッピングするエンドツーエンドのモーションプランニングシステムを提案する。この手法により、ごみだらけの環境でも安全かつ目的指向のナビゲーションが実現された。実飛行では障害物なしで100%の成功を達成し、シミュレーションでは88%のゴール到達精度を示した。これにより、自律飛行のための直接的な認識から行動への学習の可能性が裏付けられた。

ABSTRACT

In this work, a novel, end-to-end motion planning method is proposed for quadrotor navigation in cluttered environments. The proposed method circumvents the explicit sensing-reconstructing-planning in contrast to conventional navigation algorithms. It uses raw depth images obtained from a front-facing camera and directly generates local motion plans in the form of smooth motion primitives that move a quadrotor to a goal by avoiding obstacles. Promising training and testing results are presented in both AirSim simulations and real flights with DJI F330 Quadrotor equipped with Intel RealSense D435. The proposed system in action can be found in https://youtu.be/pYvKhc8wrTM.

研究の動機と目的

  • センシング、再構築、計画モジュール間の不一致や誤差の伝搬を抱える、モジュール型でパイプラインベースのナビゲーションシステムの限界を解消すること。
  • 明示的な障害物再構築を回避し、センサー入力を制御行動に直接マッピングする統合的でエンドツーエンドの運動計画システムを構築すること。
  • 前面カメラからの生の深度画像のみを用いて、部分的に把握された複雑な環境でも安全かつ効率的なナビゲーションを可能にすること。
  • DJI F330マルチローターにIntel RealSense D435を搭載し、高精度なAirSimシミュレーションと実飛行の両方で手法を検証すること。

提案手法

  • 状態は32×32の生の深度画像と3×1の相対的位置ベクトルから構成され、約75,000パラメータを持つ深層Qネットワーク(DQN)を用いて行動にマッピングされる。
  • 行動は3次ベジエ曲線で定義された運動プリミティブであり、前面カメラの視野が限られているため、前進を促す18種類のプリミティブが事前に定義されている。
  • 行動価値関数は深層ニューラルネットワークを用いて近似され、高次元の状態・行動空間における一般化を可能にしている。
  • 報酬関数は、ゴールパスへの接近を奨励し、5mを超える逸脱にはペナルティを科し、衝突には深刻なペナルティを課すように設計されており、進行度(Δd)とゴールまでの距離(dt)に基づく中間報酬も含まれる。
  • 学習の安定化のため、経験再生とターゲットネットワークを用いたDQNの学習が行われ、ハイパーパrameterは試行錯誤によって調整された。
  • 本システムは、PX4ファームウェアを搭載したDJI F330マルチローターとRealSense D435深度センシングを用いて、AirSimシミュレーションおよび実飛行の両方で評価された。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドの深層強化学習エージェントは、生の深度画像と相対的ゴール位置のみを用いて、未知で複雑な環境をナビゲートできるか?
  • RQ2シミュレーションと実飛行の両環境において、エンドツーエンドRLベースのプランナの成功確率、安全性、ナビゲーション効率はどのように比較できるか?
  • RQ3再トレーニングなしで、以前に見たことのない環境にどの程度一般化できるか?
  • RQ4ノイズの多い実世界の深度観測と不完全な制御実行は、エージェントの安全かつ目的指向のナビゲーション能力にどのように影響を与えるか?
  • RQ5部分的に把握された環境において、障害物回避と効率的な経路追従の両方の学習を効果的に行うための報酬形状戦略は何か?

主な発見

  • AirSimシミュレーションでは、25回の安全飛行のうち88%の成功率を達成し、86%の試行で衝突がなかった。
  • 障害物のない実飛行では、5回の試行すべてでゴールに到達し、平均ナビゲーション時間は20秒、平均距離は3.50mであった。
  • 2つの大きな長方形の障害物を含む実飛行では、80%の安全飛行率を達成し、2番目の試行で1回の衝突があり、3番目の試行で初期経路に沿って最大1.55mまで到達した。
  • 障害物が豊富な環境では、エージェントが最初の障害物を回避した後、しばしば開放された領域で停止またはホバリングするなど、慎重な行動を示した。
  • 本手法は、RealSense D435からのノイズの多い深度データや、実世界での不完全な制御実行にもかかわらず、未確認の環境への一般化がうまくいった。
  • 報酬関数の設計により、ゴールへの進行と障害物回避の両方がうまくバランスされ、シミュレーションおよび実飛行の両方で高い成功確率と安全性が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。