Skip to main content
QUICK REVIEW

[論文レビュー] Learning Unmanned Aerial Vehicle Control for Autonomous Target Following

Siyi Li, Tianbo Liu|arXiv (Cornell University)|Sep 24, 2017
Reinforcement Learning in Robotics参考文献 27被引用数 3
ひとこと要約

本論文は、畳み込みニューラルネットワークポリシーとPIDコントローラーを組み合わせた階層的ディープ強化学習アプローチを提案し、自律型ドローンによるターゲット追従の安定的でデータ効率の良い学習を可能にする。低レベルのモータ動作ではなく、高レベルの参照指令を学習することで、シミュレーションから実世界のDJIクアッドロプタに強力な一般化能力を備えたロバストなポリシー転送を実現し、極端な失敗を最小限に抑える。

ABSTRACT

While deep reinforcement learning (RL) methods have achieved unprecedented successes in a range of challenging problems, their applicability has been mainly limited to simulation or game domains due to the high sample complexity of the trial-and-error learning process. However, real-world robotic applications often need a data-efficient learning process with safety-critical constraints. In this paper, we consider the challenging problem of learning unmanned aerial vehicle (UAV) control for tracking a moving target. To acquire a strategy that combines perception and control, we represent the policy by a convolutional neural network. We develop a hierarchical approach that combines a model-free policy gradient method with a conventional feedback proportional-integral-derivative (PID) controller to enable stable learning without catastrophic failure. The neural network is trained by a combination of supervised learning from raw images and reinforcement learning from games of self-play. We show that the proposed approach can learn a target following policy in a simulator efficiently and the learned behavior can be successfully transferred to the DJI quadrotor platform for real-world UAV control.

研究の動機と目的

  • 実世界のUAV制御におけるモデルフリーのディープ強化学習の高いサンプル複雑性と不安定性に対処する。
  • 手動で調整されたコントローラーとエキスパートラベル付きデータに依存する従来の2段階パイプラインの限界を克服する。
  • 多様な環境に一般化可能な、センシングと制御ポリシーのエンドツーエンド学習を可能にする。
  • 従来のPIDコントローラーとディープRLポリシー・ネットワークを統合することで、安定的で安全な学習を実現する。
  • 学習済みポリシーを物理的DJIクアッドロプタープラットフォームにシミュレーションから実世界への転送を実証する。

提案手法

  • 制御ポリシーを、生の画像観測を高レベルの参照指令にマップする1つの畳み込みニューラルネットワーク(CNN)として表現する。この参照指令はPIDコントローラーに供給される。
  • 訓練を、生の画像上の教師あり事前学習と、ポリシー最適化の安定化を目的とした自己対戦ゲームによる強化学習に分解する。
  • ディープRLポリシーが固定されたPIDコントローラーのセットポイントを生成する階層的制御アーキテクチャを採用し、学習中のシステム安定性を確保する。
  • ターゲット追従性能に基づくスカラーリワード信号を用いて、ポリシー勾配法によりネットワーク全体を訓練する。
  • ドメインランダマイゼーションとシミュレーション内での自己対戦を活用し、未確認の環境においても耐性と一般化能力を向上させる。
  • ROS経由で、地上のGPU上で推論を行い、NUCを介してリアルタイムのコマンドマッピングを実行することで、学習済みポリシーを実際のDJI Matrice 100クアッドロプタにデプロイする。

実験結果

リサーチクエスチョン

  • RQ1探索中に極端な失敗を伴わず、シミュレーション内で安定して学習可能な、UAVターゲット追従のためのディープ強化学習ポリシーは構築可能か?
  • RQ2シミュレーションで学習したポリシーは、センサーノイズ、制御遅延、ハードウェア差異を伴う実世界環境において、どの程度一般化可能か?
  • RQ3学習済みポリシーと従来のPIDコントローラーを組み合わせることで、データ効率と学習安定性がどの程度向上するか?
  • RQ4センシングと制御のポリシーをエンドツーエンドで学習することで、分離されたセンシング・制御モジュールよりも優れた一般化能力が得られるか?
  • RQ5微調整なしに、シミュレーションで学習したポリシーを実世界のUAVに直接転送した場合の性能はいかがなものか?

主な発見

  • 提案された階層的アプローチは、同じ設定下で標準的なモデルフリーRLとは異なり、極端な失敗を伴わず安定した訓練を達成した。
  • エンドツーエンドで訓練されたポリシーは、シミュレーション内で5000ステップ以上にわたりターゲットを目標状態の小さな範囲内に維持し、正規化された状態空間において平均偏差が0.1未満を維持した。
  • 異なる背景や干渉要因を伴う未確認のシナリオに対しても、良好な一般化能力を示し、視覚的変動に対して中程度の耐性を示した。
  • 実世界のテストでは、センサーノイズ、IMU/GPS遅延、ハードウェア差異を伴いながらも、最大4000ステップ(約3分間)にわたり移動するターゲットを正常に追従した。
  • 実世界ではシミュレーションと比較して制御精度がわずかに低下するにとどまり、シミュレーションから実世界への転送性が極めて高いことを示した。
  • 部分的遮断下でも効果的な一般化が達成されたが、干渉要因がターゲットと視覚的に類似している場合には性能がわずかに低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。