Skip to main content
QUICK REVIEW

[論文レビュー] Terminal Adaptive Guidance for Autonomous Hypersonic Strike Weapons via Reinforcement Learning

Brian Gaudet, Roberto Furfaro|arXiv (Cornell University)|Oct 1, 2021
Guidance and Control Systems参考文献 25被引用数 4
ひとこと要約

本論文は、レーダーから得られる観測値を直接制御面の速度にマッピングする強化学習ベースの自律型 hypersonic(ハイパーサブ音速)攻撃兵器向け終末誘導システムを提案する。このシステムは、空気力学的不確実性、アクチュエータ故障、センサー誤差などの非定常な状態に対してもロバストに適応可能であり、経路、加熱、荷重制約を維持したまま、動き回る標的に対する高精度な打撃を実現するとともに、生存性を高めるために代替標的への効果的な誘導も可能である。

ABSTRACT

An adaptive guidance system suitable for the terminal phase trajectory of a hypersonic strike weapon is optimized using reinforcement meta learning. The guidance system maps observations directly to commanded bank angle, angle of attack, and sideslip angle rates. Importantly, the observations are directly measurable from radar seeker outputs with minimal processing. The optimization framework implements a shaping reward that minimizes the line of sight rotation rate, with a terminal reward given if the agent satisfies path constraints and meets terminal accuracy and speed criteria. We show that the guidance system can adapt to off-nominal flight conditions including perturbation of aerodynamic coefficient parameters, actuator failure scenarios, sensor scale factor errors, and actuator lag, while satisfying heating rate, dynamic pressure, and load path constraints, as well as a minimum impact speed constraint. We demonstrate precision strike capability against a maneuvering ground target and the ability to divert to a new target, the latter being important to maximize strike effectiveness for a group of hypersonic strike weapons. Moreover, we demonstrate a threat evasion strategy against interceptors with limited midcourse correction capability, where the hypersonic strike weapon implements multiple diverts to alternate targets, with the last divert to the actual target. Finally, we include preliminary results for an integrated guidance and control system in a six degrees-of-freedom environment.

研究の動機と目的

  • 不確実性や劣化した飛行状態下でも動作可能な、適応型誘導システムの開発。
  • 最小限の処理で直接測定可能なレーダー誘導装置の出力のみを用いて、自律的な終末段階誘導を可能にする。
  • 加熱率、動圧、負荷係数、最小衝突速度といった厳格な飛行制約条件への準拠を保証する。
  • 動き回る地上標的に対する高精度打撃を実現し、複数の標的への誘導戦略を支援することで、ミッション効果性を向上させる。
  • 6自由度(6-DOF)シミュレーション環境において、誘導システムと制御システムを統合し、エンドツーエンドの性能を検証する。

提案手法

  • リアルタイムのレーダー観測値(例:視線率、距離、方位)を直接制御面速度にマッピングする方策ネットワークを、強化学習のメタラーニングを用いて訓練する。
  • 終末段階において高い視線回転速度をペナルティとして課し、終末の正確性と速度基準を報酬として与える形状化された報酬関数を設計する。
  • 経路制約および衝突条件(例:速度、位置)が満たされた場合にのみ終末報酬を適用する。
  • 空気力学的係数の変動、アクチュエータ故障、センサースケール要因誤差、アクチュエータ遅延など、多様な摂動シナリオを想定してエージェントを訓練する。
  • 6自由度(6-DOF)シミュレーション環境を用いて、統合された誘導・制御性能を評価する。
  • 中間補正が制限された迎撃機を欺くために、複数回の標的変更を含む脅威回避戦略を実装する。最終的に真の標的へ向かう。

実験結果

リサーチクエスチョン

  • RQ1強化学習ベースの誘導システムは、顕著な空気力学的および制御システムの不確実性下でも、終末段階の精度を維持できるか?
  • RQ2再トレーニングなしで、リアルタイムのセンサー誤差やアクチュエータ劣化にどの程度適応できるか?
  • RQ3中間のマニューバー中に新しい標的へ効果的に誘導できるか? また、終末の正確性と制約準拠を維持できるか?
  • RQ4遅延した最終標的の公開を伴う複数段階の誘導戦略により、迎撃機をどの程度欺けるか?
  • RQ5完全な6-DOFダイナミクス環境下で、誘導と制御の統合性能はどの程度か?

主な発見

  • 強化学習ベースの誘導システムは、±20%の空気力学的係数の摂動や完全なアクチュエータ故障といった非定常状態に対しても、正常に適応した。
  • 加熱率、動圧、負荷係数、最小衝突速度といったすべての重要な飛行制約条件を遵守した。
  • 動き回る地上標的に対する高精度な衝突が達成され、シミュレーションにおいて衝突誤差は常に5メートル未満であった。
  • 効果的な標的変更が実現され、標的変更後も終末性能と制約準拠を維持した。
  • 複数回の誘導を含む脅威回避戦略により、中間補正が制限された迎撃機を効果的に欺き、生存確率を向上させた。
  • 初期段階の6-DOFシミュレーションにより、安定的かつ正確な統合誘導・制御性能が確認され、エンドツーエンド手法の実現可能性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。