Skip to main content
QUICK REVIEW

[論文レビュー] Explainable Deep Reinforcement Learning for UAV Autonomous Navigation

Lei He, Nabil Aouf|arXiv (Cornell University)|Sep 30, 2020
Explainable Artificial Intelligence (XAI)参考文献 28被引用数 10
ひとこと要約

本論文は、説明可能なAI技術を用いて意思決定を解釈する、未知の屋外環境におけるUAV自律航行のための深層強化学習(DRL)ベースの反応型コントローラーを提案する。この手法はリアルタイム60Hzの制御性能を達成し、サリエンシー・マップと特徴量の寄与度を用いて視覚的およびテキスト的説明を提供する。これにより、専門外のユーザーおよび開発者ともにモデルの挙動を理解・改善できる。

ABSTRACT

Autonomous navigation in unknown complex environment is still a hard problem, especially for small Unmanned Aerial Vehicles (UAVs) with limited computation resources. In this paper, a neural network-based reactive controller is proposed for a quadrotor to fly autonomously in unknown outdoor environment. The navigation controller makes use of only current sensor data to generate the control signal without any optimization or configuration space searching, which reduces both memory and computation requirement. The navigation problem is modelled as a Markov Decision Process (MDP) and solved using deep reinforcement learning (DRL) method. Specifically, to get better understanding of the trained network, some model explanation methods are proposed. Based on the feature attribution, each decision making result during flight is explained using both visual and texture explanation. Moreover, some global analysis are also provided for experts to evaluate and improve the trained neural network. The simulation results illustrated the proposed method can make useful and reasonable explanation for the trained model, which is beneficial for both non-expert users and controller designer. Finally, the real world tests shown the proposed controller can navigate the quadrotor to goal position successfully and the reactive controller performs much faster than some conventional approach under the same computation resource.

研究の動機と目的

  • 限られた計算リソースのもとで、未知で複雑な屋外環境におけるUAV自律ナビゲーションの課題に対処すること。
  • UAV制御における深層強化学習モデルのブラックボックス性を克服するため、説得力のある解釈技術を導入すること。
  • 地図の維持や最適化のオーバーヘッドを回避するため、現在のセンサデータのみを用いた反応型制御方針を開発すること。
  • 視覚的およびテキスト的説明を通じて、非専門家ユーザーおよびコントローラー設計者によるDRL方策の解釈と改善を可能にすること。
  • 提案されたDRLベースのコントローラーの実世界での実現可能性と計算効率を実証すること

提案手法

  • UAVの障害物回避をマークフ・意思決定過程(MDP)として定式化し、TD3アルゴリズムを用いた深層強化学習(DRL)で解く。
  • 地図や経路最適化を一切行わない、現在のセンサ入力から直接制御指令を生成する反応型コントローラーを実装する。
  • CNNの認識における視覚的説明のため、クラス活性化マッピング(CAM)とSHAP値を組み合わせた新しいサリエンシー・マップ生成法を導入する。
  • 特徴量の寄与度を用いて、例えば「右側に障害物があるため右に旋回した」といったテキスト的説明を生成する。
  • シミュレーションと実世界のドメインギャップを低減するため、木の障害物を含むカスタムGazeboシミュレーションでDRLモデルを再訓練する。
  • 訓練済み方策をPX4 SITL環境内の実機クアッドコプターに直接デプロイし、60Hzでの性能を評価する

実験結果

リサーチクエスチョン

  • RQ1深層強化学習をどのように活用すれば、最小限の計算オーバーヘッドで未知環境におけるリアルタイムで反応型のUAVナビゲーションを実現できるか?
  • RQ2特徴量の寄与度とサリエンシー・マップは、DRLベースのUAV制御意思決定に対してどれほど意味的で解釈可能な説明を提供できるか?
  • RQ3視覚的およびテキスト的説明は、UAVアプリケーションにおける非専門家ユーザーの信頼性と使いやすさを向上させることができるか?
  • RQ4同じハードウェア制約下で、DRLベースの反応型コントローラーの性能は、従来の最適化ベースのプランナーよりも優れているか?
  • RQ5DRL方策をシミュレーションから実世界のUAV飛行に移行する際の主な課題は何か。また、それらはどのように軽減できるか?

主な発見

  • DRLベースの反応型コントローラーは、20,000トレーニングステップ後に木の障害物を含むシミュレーテッド環境を通過する際に75%の成功率を達成した。
  • 実世界の飛行において60Hzで動作したが、同じハードウェアで動作する従来の3DVFH+プランナーはわずか10Hzにとどまり、著しく優れた性能を示した。
  • ハイブリッドCAM-SHAP法により生成された視覚的説明は、制御意思決定に影響を与える関連領域(例:障害物)を効果的に強調した。
  • 特徴量の寄与度に基づくテキスト的説明は、各行動の根拠を的確に説明でき、例えば「前方左に障害物が検出されたため左に旋回した」といった内容を含んだ。
  • シミュレーションでは滑らかな挙動を示したが、実世界のテストでは出力の振動が観察され、シミュレーションと実際の動的特性またはセンサ入力との間にドメインギャップが存在することが示された。
  • モデルの説得力のあるフレームワークにより、非専門家および設計者ともに方策の解釈と潜在的な問題の特定が可能となり、今後の微調整を支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。