Skip to main content
QUICK REVIEW

[論文レビュー] Integrated and Adaptive Guidance and Control for Endoatmospheric Missiles via Reinforcement Learning

Brian Gaudet, Roberto Furfaro|arXiv (Cornell University)|Sep 8, 2021
Guidance and Control Systems参考文献 24被引用数 4
ひとこと要約

本論文は、航行出力を制御面の偏航量へ直接マッピングする統合的で適応型誘導・制御のための強化学習メタラーニングフレームワークを提案する。本システムは、大きな飛行エナメル範囲の変動、非定格な空力パラメータ、フレキシブルボディダイナミクス、およびサーチャー誘発の姿勢誤差に対しても、ロバストな迎撃性能を達成しており、シミュレーションにおいて伝統的な比例誘導と三ループオートパイLOTを組み合わせた手法を上回っている。

ABSTRACT

We apply a reinforcement meta-learning framework to optimize an integrated and adaptive guidance and flight control system for an air-to-air missile. The system is implemented as a policy that maps navigation system outputs directly to commanded rates of change for the missile's control surface deflections. The system induces intercept trajectories against a maneuvering target that satisfy control constraints on fin deflection angles, and path constraints on look angle and load. We test the optimized system in a six degrees-of-freedom simulator that includes a non-linear radome model and a strapdown seeker model, and demonstrate that the system adapts to both a large flight envelope and off-nominal flight conditions including perturbation of aerodynamic coefficient parameters and center of pressure locations, and flexible body dynamics. Moreover, we find that the system is robust to the parasitic attitude loop induced by radome refraction and imperfect seeker stabilization. We compare our system's performance to a longitudinal model of proportional navigation coupled with a three loop autopilot, and find that our system outperforms this benchmark by a large margin. Additional experiments investigate the impact of removing the recurrent layer from the policy and value function networks, performance with an infrared seeker, and flexible body dynamics.

研究の動機と目的

  • 空対空ミサイルの、大きな飛行エナメル範囲の変動および非定格な状態に適応可能な統合的誘導・制御システムの開発を目的とする。
  • エンジンの偏航制限、見通し角および負荷の経路制限、およびサーチャー誘発の余剰姿勢ループに対処することを目的とする。
  • 従来の誘導則およびオートパイLOTを、航行出力を制御面指令に直接マッピングする学習済みポリシーに置き換えることを目的とする。
  • 空力係数の摂動、重心位置のずれ、およびフレキシブルボディダイナミクスに対するロバストネスを評価することを目的とする。
  • 高精度の6自由度シミュレーションにおいて、ベンチマークの比例誘導と三ループオートパイLOTを上回ることを実証することを目的とする。

提案手法

  • メタラーニングフレームワークを用いて、多様な飛行状態に一般化可能な深層強化学習ポリシーを訓練する。
  • ポリシーは、リアルタイムの航行システム出力を、ミサイル制御面の偏航変化率への命令値に直接マッピングする。
  • 制御行動の時間的依存性をモデル化するため、ポリシーおよび価値関数ネットワークに再帰的ニューラルネットワークを組み込む。
  • 6自由度のシミュレーション環境には、非線形的レーダムド効果およびストラップダウンサーチャーモデルを含め、現実的なサーチャー動的特性を再現する。
  • 訓練環境には、空力係数、重心位置、フレキシブルボディダイナミクスの摂動を含め、ロバストネスをテストする。
  • 性能は、三ループオートパイLOTを備えたベンチマークの縦方向比例誘導システムと比較して評価する。

実験結果

リサーチクエスチョン

  • RQ1一貫した強化学習ポリシーは、変動する空力および動的条件下でも、迎撃ミサイルの全飛行エナメル範囲を効果的に処理できるか?
  • RQ2ポリシーおよび価値関数ネットワークに再帰層を組み込むことで、システム性能および適応性にどのような影響を与えるか?
  • RQ3レーダムド屈折および不完全な安定化に起因するサーチャー誘発の余剰姿勢ループに対して、システムのロバストネスはどの程度高いか?
  • RQ4フレキシブルボディダイナミクスおよび非定格な空力パラメータの変動下で、システムはどのように性能を発揮するか?
  • RQ5インターセプト成功確率および制約満足度の観点から、学習済みポリシーは古典的な比例誘導と三ループオートパイLOTを上回るか?

主な発見

  • 強化学習ベースのシステムは、エンジン偏航の制御制限および見通し角・負荷の経路制限を満たす迎撃軌道を効果的に生成した。
  • 空力係数および重心位置の摂動を含む、大きな飛行エナメル範囲の変動に対しても、システムはロバストな性能を示した。
  • レーダムド屈折および不完全なサーチャー安定化に起因する余剰姿勢ループに対しても、システムは安定して効果的であった。
  • ポリシーおよび価値関数ネットワークに再帰層を組み込むことで、特に時間的ダイナミクスの処理および状態変化への適応性が著しく向上した。
  • インターセプト成功確率および制約遵守の観点で、ベンチマークの比例誘導と三ループオートパイLOTを上回った。
  • 赤外線サーチャーおよびフレキシブルボディダイナミクスを用いた実験により、異なるセンサーおよび機体構成に対しても、システムの適応性およびロバストネスが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。