Skip to main content
QUICK REVIEW

[論文レビュー] Autonomous Six-Degree-of-Freedom Spacecraft Docking Maneuvers via Reinforcement Learning

Charles Oestreich, Richard Linares|arXiv (Cornell University)|Aug 7, 2020
Space Satellite Systems and Control参考文献 23被引用数 10
ひとこと要約

本論文は、近接ポリシー最適化(PPO)を用いた強化学習ベースのポリシーを提案し、6自由度(6-DOF)の自律的宇宙船ドッキングを実現する。この手法により、計算コストが低く、ロバストなフィードバック制御が可能となる。本手法は、アポロのトランスポジションおよびドッキングシナリオのシミュレーション環境でドッキングポリシーを学習し、最適制御と同等の性能を達成した。また、不確実性や制約を扱う際の最小限のサブ最適性を示した。

ABSTRACT

A policy for six-degree-of-freedom docking maneuvers is developed through reinforcement learning and implemented as a feedback control law. Reinforcement learning provides a potential framework for robust, autonomous maneuvers in uncertain environments with low on-board computational cost. Specifically, proximal policy optimization is used to produce a docking policy that is valid over a portion of the six-degree-of-freedom state-space while striving to minimize performance and control costs. Experiments using the simulated Apollo transposition and docking maneuver exhibit the policy's capabilities and provide a comparison with standard optimal control techniques. Furthermore, specific challenges and work-arounds, as well as a discussion on the benefits and disadvantages of reinforcement learning for docking policies, are discussed to facilitate future research. As such, this work will serve as a foundation for further investigation of learning-based control laws for spacecraft proximity operations in uncertain environments.

研究の動機と目的

  • 不確実な環境下でも安定した自律的6-DOFドッキングポリシーの開発を目的とする。
  • 従来の最適制御が動的で不確実的かつ複雑な制約を扱う際の限界を克服することを目的とする。
  • モデルフリーの強化学習を用いた近接飛行操作の実現可能性を示し、搭載計算リソースの低消費を目的とする。
  • GPOPS-IIを用いて、学習済みRLポリシーと標準的な最適制御手法を比較することを目的とする。
  • 今後のRLベースの宇宙船制御研究のための、主な実装上の課題とその回避策を同定・文書化することを目的とする。

提案手法

  • 状態観測値から制御入力をマッピングするポリシーを学習するために、近接ポリシー最適化(PPO)が用いられ、形状付けられた報酬関数を最大化するように最適化される。
  • LQRにインspiredされた豊富な報酬関数が設計され、全状態空間におけるバランスの取れた収束と、軌道の持続時間の制御を可能にする。
  • エピソード終了を伴わない連続的で滑らかな衝突ペナルティが適用され、エージェントが安全制約を無視する学習を避ける。
  • ポリシーはリアルタイムのフィードバック制御則として実装され、飛行ハードウェアへの低コストな実装が可能となる。
  • KLダイバージェンスのクリッピングや学習率といったハイパーパrameterが、学習の安定化とポリシー更新の忠実度の維持を目的に動的に調整される。
  • 本手法は、相対的並進および回転運動を含む、高精度なアポロのトランスポジションおよびドッキングマニューバーのシミュレーション環境で評価された。

実験結果

リサーチクエスチョン

  • RQ1強化学習は、衝突を回避し、制御労力を最小限に抑える安定的かつ一般化可能な6-DOFドッキングポリシーを生成できるか?
  • RQ2コストと収束性の観点から、RLベースのポリシーは従来の最適制御手法と比べてどのように性能を発揮するか?
  • RQ3宇宙船ドッキングのためのRLポリシーを訓練する際の主な課題は何か。また、それらはどのように緩和できるか?
  • RQ4RLポリシーは、飛行システムに適した低搭載計算コストで実装可能か?
  • RQ5報酬形状付けは、望ましい軌道プロファイルおよび到達時間への到達を効果的にガイドするか?

主な発見

  • PPOベースのポリシーは、シミュレーテッドアポロのトランスポジションおよびドッキングシナリオにおいて、衝突を回避しながら6-DOFドッキングに成功し、状態空間のサブセットにおいてもロバストであることが示された。
  • RLポリシーは、GPOPS-IIソフトウェアスイートによって生成された最適解の2.5%以内の性能を達成した。これは、最小限の損失で強いサブ最適性を示している。
  • エピソード終了を伴わない連続的衝突ペナルティの使用により、エージェントが安全制約を無視する学習を避けることができた。これは、一部の先行RL設定とは対照的である。
  • KLダイバージェンスのクリッピングと学習率の動的調整により、学習が安定化され、高分散探索フェーズにおけるポリシーの崩壊を防止できた。
  • LQRにインspiredされた報酬形状付けにより、状態空間全体での一貫性ある収束と、軌道時間の制御が向上したが、目標時間は完全には達成されなかった。
  • ポリシーは中程度の計算リソースしか要せず、現在の宇宙船アビオニクスにおけるリアルタイム実装の可能性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。