Skip to main content
QUICK REVIEW

[論文レビュー] Time-Varying Formation Controllers for Unmanned Aerial Vehicles Using Deep Reinforcement Learning

Ronny Conde, J.R. Llata|arXiv (Cornell University)|Jun 5, 2017
Distributed Control Multi-Agent Systems参考文献 10被引用数 11
ひとこと要約

本稿では、時間変動する編隊を能率的に達成するため、無人航空機(UAV)向けの深層強化学習(DRL)ベースのマルチエージェント制御器を提案する。集中型のクライアントと深層Qネットワークを用いることで、状態観測のみを用いてスケーラブルで移植可能なポリシーを学習し、タスク間でアーキテクチャやハイパーパrameterの変更なしに迅速な収束を達成する。

ABSTRACT

We consider the problem of designing scalable and portable controllers for unmanned aerial vehicles (UAVs) to reach time-varying formations as quickly as possible. This brief confirms that deep reinforcement learning can be used in a multi-agent fashion to drive UAVs to reach any formation while taking into account optimality and portability. We use a deep neural network to estimate how good a state is, so the agent can choose actions accordingly. The system is tested with different non-high-dimensional sensory inputs without any change in the neural network architecture, algorithm or hyperparameters, just with additional training.

研究の動機と目的

  • 動的で時間変動する編隊のためのスケーラブルで移植可能なUAV編隊制御器の設計という課題に取り組む。
  • 従来の制御手法が複雑で非定常な編隊タスクを処理する際の限界を克服する。
  • エンドツーエンド学習を用いてUAVが望ましい編隊に迅速かつ効率的に到達できるようにする。
  • 再トレーニングやアーキテクチャの変更なしに、異なる編隊形状間でのポリシーの一般化を保証する。
  • 最小限のセンシング入力で安定した性能を発揮し、多様なシナリオにおいて一貫した性能を示すことを目指す。

提案手法

  • 集中型クライアントと分散型エージェントを持つマルチエージェント深層強化学習フレームワークを採用する。
  • ポリシー学習のための状態行動価値関数を推定するために深層Qネットワーク(DQN)を用いる。
  • 目標編隊への迅速な収束を促進する報酬関数を用いてポリシーをトレーニングする。
  • 深層強化学習の文脈でのトレーニング安定化のために経験リプレイとターゲットネットワークを適用する。
  • 高次元のセンシング前処理を避けるために、原始的な状態観測(例:相対位置と速度)を入力とする。
  • 同じニューラルネットワークアーキテクチャを複数の編隊形状で使用し、追加のファインチューニングのみでポータビリティを確保する。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習は、時間変動する編隊のためのスケーラブルで移植可能なUAV編隊制御器を学習できるか?
  • RQ2DRLポリシーは、アーキテクチャやハイパーパrameterの最小限の変更で、さまざまな編隊形状にどれほど一般化できるか?
  • RQ3低次元の状態入力のみを用いて、目標編隊への迅速な収束をどの程度達成できるか?
  • RQ4集中型トレーニングと分散型実行(CTDE)フレームワークは、マルチUAV協調タスクにおいてどのように機能するか?
  • RQ5学習済みポリシーは、再トレーニングなしに多様な編隊構成においても安定性と最適性を維持できるか?

主な発見

  • DRLベースの制御器は、多様な時間変動する編隊に高い信頼性と高速性で到達を実現した。
  • 同じニューラルネットワークアーキテクチャが、再トレーニングやハイパーパrameter調整なしに複数の編隊形状に一般化した。
  • トレーニング中の累積報酬偏差が一貫して低く保たれたことから、目標編隊への迅速な収束が達成された。
  • 相対位置と速度のみを入力として使用しても性能が維持されたことから、強靭性が示された。
  • ある編隊タイプでトレーニングしたことで、他の編隊タイプへの一般化が可能であり、最小限の追加ファインチューニングで実現された。
  • 集中型クライアントと分散型実行の組み合わせにより、複雑な編隊タスクにおいて安定したトレーニングと効果的なマルチエージェント協調が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。