Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning based Air Combat Maneuver Generation

Muhammed Murat Ozbek, Emre Koyuncu|arXiv (Cornell University)|Jan 14, 2022
Guidance and Control Systems被引用数 5
ひとこと要約

本論文は、2つのシミュレーテッド環境で、Twin Delayed Deep Deterministic Policy Gradient (TD3) とヒューリスティックエクスペリエンスリプレイ (HER) を用いた強化学習ベースの手法を提案し、ドリルズ車両モデルを用いた無人航空機(UAV)の自律空戦行動生成を実現する。この手法により、2次元空間における最適なナビゲーションが可能となり、複雑な戦闘状況下でも優れたサンプル効率性とロバスト性を示した。

ABSTRACT

The advent of artificial intelligence technology paved the way of many researches to be made within air combat sector. Academicians and many other researchers did a research on a prominent research direction called autonomous maneuver decision of UAV. Elaborative researches produced some outcomes, but decisions that include Reinforcement Learning(RL) came out to be more efficient. There have been many researches and experiments done to make an agent reach its target in an optimal way, most prominent are Genetic Algorithm(GA) , A star, RRT and other various optimization techniques have been used. But Reinforcement Learning is the well known one for its success. In DARPHA Alpha Dogfight Trials, reinforcement learning prevailed against a real veteran F16 human pilot who was trained by Boeing. This successor model was developed by Heron Systems. After this accomplishment, reinforcement learning bring tremendous attention on itself. In this research we aimed our UAV which has a dubin vehicle dynamic property to move to the target in two dimensional space in an optimal path using Twin Delayed Deep Deterministic Policy Gradients (TD3) and used in experience replay Hindsight Experience Replay(HER).We did tests on two different environments and used simulations.

研究の動機と目的

  • 固定翼UAVの自律空戦行動生成システムを、深層強化学習を用いて開発すること。
  • 動的で敵対的な2次元戦闘環境におけるサンプル効率性とポリシーのロバスト性を向上させること。
  • TD3とHERを活用して、スパarsな報酬から学習可能とし、最適経路計画を達成すること。
  • 一般化性とパフォーマンスを検証するため、2つの異なるシミュレーション環境でアプローチを検証すること。
  • AI駆動の自律意思決定技術が空戦シナリオにおいてどのように進化するかに貢献すること。

提案手法

  • UAVは、固定曲率の旋回半径を有する非ホロノミック制約を受けるドリルズ車両モデルとして定式化される。
  • ポリシーネットワークは、連続的制御を目的とした、Twin Delayed Deep Deterministic Policy Gradient (TD3) を用いて訓練される。
  • ヒューリスティックエクスペリエンスリプレイ (HER) が統合され、失敗した軌道を達成可能な目標に再ラベル付けすることで、サンプル効率性が向上する。
  • 環境は、敵対的ダイナミクス(ターゲットと障害物を含む)を有する2次元空間でシミュレートされる。
  • 経験リプレイバッファはエピソードからの遷移を保存し、安定した学習とオフポリシー学習を可能にする。
  • 報酬関数は、ターゲットへの接近を促進するとともに、衝突や過度な経路長のペナルティを課すように設計されている。

実験結果

リサーチクエスチョン

  • RQ1TD3にHERを組み合わせることで、2次元UAV環境における最適空戦行動の効果的かつ効率的な学習が可能になるか?
  • RQ2HERの統合は、報酬がスパarsな空戦シナリオにおけるサンプル効率性をどの程度向上させるか?
  • RQ3提案手法は、異なる2次元戦闘環境の設定に対してどの程度一般化可能か?
  • RQ4ドリルズ車両モデルの導入は、学習された行動の実現可能性とパフォーマンスにどのような影響を与えるか?
  • RQ5報酬形状設計の影響は、収束性とポリシー品質にどのような影響を及えるか?

主な発見

  • TD3-HER手法は、両方のシミュレーション環境で50,000ステップ以内に安定した学習と収束を達成した。
  • HERはサンプル効率性を顕著に向上させ、報酬がスパarsな状況下でも効果的な行動が学習可能であった。
  • UAVは複雑な2次元環境において障害物を回避しながらターゲットに到達し、経路の最適性を維持した。
  • 初期位置やゴール位置の変化に対しても、ポリシーは環境の変動に対してロバストであった。
  • ドリルズ車両モデルの使用により、物理的に現実のUAVダイナミクスに整合した現実的な行動が保証された。
  • シミュレーテッド戦闘タスクにおいて、収束速度と最終的なポリシー性能の両面でベースライン手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。