[論文レビュー] Reinforcement Learning for Low-Thrust Trajectory Design of Interplanetary Missions
本論文は、プロセスノイズ、観測誤差、制御誤差、および欠落推力イベントを含む複数の不確実性を伴う低推力惑星間軌道設計のための強化学習フレームワークを提案する。この手法は最適制御問題をマークフ・決定過程(MDP)として定式化し、深層ニューラルネットワークを訓練して閉ループガイダンス則を生成する。確率的摂動が存在するにもかかわらず、地球-火星ミッションのシミュレーションにおいて高い制約満足度とペイロード質量効率を達成した。
This paper investigates the use of Reinforcement Learning for the robust design of low-thrust interplanetary trajectories in presence of severe disturbances, modeled alternatively as Gaussian additive process noise, observation noise, control actuation errors on thrust magnitude and direction, and possibly multiple missed thrust events. The optimal control problem is recast as a time-discrete Markov Decision Process to comply with the standard formulation of reinforcement learning. An open-source implementation of the state-of-the-art algorithm Proximal Policy Optimization is adopted to carry out the training process of a deep neural network, used to map the spacecraft (observed) states to the optimal control policy. The resulting Guidance and Control Network provides both a robust nominal trajectory and the associated closed-loop guidance law. Numerical results are presented for a typical Earth-Mars mission. First, in order to validate the proposed approach, the solution found in a (deterministic) unperturbed scenario is compared with the optimal one provided by an indirect technique. Then, the robustness and optimality of the obtained closed-loop guidance laws is assessed by means of Monte Carlo campaigns performed in the considered uncertain scenarios. These preliminary results open up new horizons for the use of reinforcement learning in the robust design of interplanetary missions.
研究の動機と目的
- プロセスノイズ、観測誤差、制御誤差、および欠落推力イベントを含む複数の不確実要因を伴う低推力惑星間ミッションにおけるロバストで閉ループ型ガイダンス則の開発。
- 従来の間接的・決定的最適化手法が確率的摂動や高い不確実性に対処する際の限界、特に冗長性が少なく地上アクセスが制限されるマイクロスペースクラフトミッションにおいて顕著であることを解決すること。
- 確定的シナリオにおける間接的最適制御解と比較することで、強化学習に基づく手法の実現可能性と最適性を検証すること。
- さまざまな確率的不確実性モデル下でのモンテカルロキャンペーンを通じて、学習済み方策のロバスト性と性能を評価すること。
- 従来手法が実用的でなくなるような状況において、深層強化学習を一般用途のフレームワークとして、ロバストな宇宙ミッション設計に応用する可能性を探索すること。
提案手法
- 最適制御問題を時間離散化されたマークフ・決定過程(MDP)として再定式化し、標準的な強化学習手法の適用を可能にする。
- 深層ニューラルネットワークを用い、プロキシマルポリシー最適化(PPO)アルゴリズムで訓練することで、宇宙船の状態観測値を最適制御入力にマッピングし、閉ループ型ガイダンス・制御方策を形成する。
- PPOアルゴリズムは、ポリシー勾配強化学習において安定性とサンプル効率に優れており、特に高次元連続制御タスクに適しているため選定された。
- 訓練プロセスでは、ガウスノイズ、制御誤差、および欠落推力イベント(MTEs)をモデル化した3次元地球-火星軌道移行をシミュレートするカスタム環境が使用された。
- ポリシーのロバストネスを評価するために、異なる不確実性シナリオ下でモンテカルロキャンペーンが実施され、終端制約違反と最終宇宙船質量が測定された。
- 制約処理を改善するためにε制約緩和技術が導入されたが、今後は制約付きMDPのようなより高度な定式化が提案されている。
実験結果
リサーチクエスチョン
- RQ1強化学習は、プロセスノイズ、観測誤差、制御誤差を含む複数の不確実要因下で、ロバストな低推力惑星間軌道設計を効果的に可能にするか?
- RQ2決定的かつ摂動なしのシナリオにおいて、PPOで訓練された方策の性能は、間接的最適制御解と比べてどの程度か?
- RQ3欠落推力イベントなどの確率的摂動下でも、学習済み方策が終端制約の満足度とペイロード質量効率をどの程度維持できるか?
- RQ4欠落推力イベントの発生タイミングが、方策の回復能力とミッション目標達成への影響にどのように関与するか?
- RQ5提案されたRLフレームワークは、ガウス分布以外の確率的力学モデルや他の惑星間ミッションに一般化可能か?
主な発見
- 決定的シナリオでは、PPO方策は間接法で計算された最適軌道と非常に近い解を得ており、本手法の正確性が検証された。
- 状態および観測の不確実性下では、終端制約を満たす成功確率が0%にとどまり、状態推定誤差に対して極めて感受性が高いことが示された。
- 推力の大きさおよび方向の制御不確実性下では、成功確率は8%であり、複数のMTEでは16.8%、単一MTEでは18.8%であった。これは中程度の耐性があることを示している。
- 単一MTEケースの69.8%、複数MTEケースの70.4%で、完全な推力喪失から正常に回復できたが、最終時刻付近にMTEが発生した場合には、ΔV補償が不十分なため失敗が発生した。
- 制約違反が大きいシナリオでは最終宇宙船質量が増加しており、制約の不適切な実行は推進剤の非効率的使用とペイロード質量の削減を引き起こすことが示された。
- 制約違反と質量結果の高い分散は、MTEの発生タイミングが極めて重要であり、RLベースのガイダンスにおける制約処理メカニズムの改善が不可欠であることを強調している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。