Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning for Low-Thrust Trajectory Design of Interplanetary Missions

Alessandro Zavoli, Lorenzo Federici|arXiv (Cornell University)|2020. 08. 19.
Spacecraft Dynamics and Control참고 문헌 29인용 수 6
한 줄 요약

이 논문은 프로크시멀 페리클로스 오르티미제이션(PPO)를 사용한 강화학습 프레임워크를 제안하여, 공정 노이즈, 관측 오차, 제어 오차, 누락된 추력 이벤트를 포함한 여러 불확실성 하에서 강건한 저추력 행성간 궤도 설계를 수행한다. 이 방법은 최적 제어 문제를 마르코프 결정 과정으로 재구성하고, 깊은 신경망을 훈련시켜 닫힌 루프 가이던스 법칙을 생성한다. 이는 확률적 외란이 존재하는 상황에서도 고도로 제약 조건을 충족시키고 페이로드 질량 효율성을 확보한 지구-화성 임무 시뮬레이션에서 성과를 거두었다.

ABSTRACT

This paper investigates the use of Reinforcement Learning for the robust design of low-thrust interplanetary trajectories in presence of severe disturbances, modeled alternatively as Gaussian additive process noise, observation noise, control actuation errors on thrust magnitude and direction, and possibly multiple missed thrust events. The optimal control problem is recast as a time-discrete Markov Decision Process to comply with the standard formulation of reinforcement learning. An open-source implementation of the state-of-the-art algorithm Proximal Policy Optimization is adopted to carry out the training process of a deep neural network, used to map the spacecraft (observed) states to the optimal control policy. The resulting Guidance and Control Network provides both a robust nominal trajectory and the associated closed-loop guidance law. Numerical results are presented for a typical Earth-Mars mission. First, in order to validate the proposed approach, the solution found in a (deterministic) unperturbed scenario is compared with the optimal one provided by an indirect technique. Then, the robustness and optimality of the obtained closed-loop guidance laws is assessed by means of Monte Carlo campaigns performed in the considered uncertain scenarios. These preliminary results open up new horizons for the use of reinforcement learning in the robust design of interplanetary missions.

연구 동기 및 목표

  • 공정 노이즈, 관측 오차, 제어 오차, 누락된 추력 이벤트를 포함한 여러 불확실성 원인 하에서 강건하고 닫힌 루프 가이던스 법칙을 개발하기 위해.
  • 전통적인 간접 및 결정론적 최적화 방법이 확률적 외란과 높은 불확실성, 특히 부득이한 冗餘성과 지상 액세스가 제한된 마이크로 우주선 임무에서 다루기 어려운 한계를 해결하기 위해.
  • 결정론적 시나리오에서 간접 최적 제어 해법과 비교하여 강화학습 기반 접근법의 타당성과 최적성 검증을 위해.
  • 다양한 확률적 불확실성 모델 하에서 몬테카를로 캠프에이션을 수행하여 학습된 정책의 강건성과 성능을 평가하기 위해.
  • 기존 방법이 비실용적이게 되는 상황에서, 딥 강화학습을 보편적 프레임워크로 활용하여 강건한 우주 임무 설계 가능성을 탐색하기 위해.

제안 방법

  • 최적 제어 문제를 시간 이산화된 마르코프 결정 과정(MDP)으로 재구성하여, 표준 강화학습 기법의 적용을 가능하게 한다.
  • 딥 신경망은 PPO 알고리즘을 통해 훈련되어 우주선 상태 관측치를 최적 제어 조작으로 매핑하며, 닫힌 루프 가이던스 및 제어 정책을 형성한다.
  • PPO 알고리즘은 정책 기반 강화학습에서의 안정성과 샘플 효율성 덕분에 고차원 연속 제어 과제에 특히 적합하여 선택되었다.
  • 훈련 과정은 3차원 지구-화성 이동을 시뮬레이션하는 커스터마이징된 환경을 사용하며, 외란은 정규 분포 노이즈, 제어 오차, 누락된 추력 이벤트(MTEs)로 모델링된다.
  • 정책의 강건성 평가를 위해 몬테카를로 캠프에이션을 수행하여 다양한 불확실성 시나리오에서 종단 제약 위반과 최종 우주선 질량을 측정한다.
  • 제약 조건 처리를 향상시키기 위해 ε-제약 완화 기법을 통합하였지만, 향후 작업으로 제약 조건이 있는 MDP와 같은 고급 수식이 제안된다.

실험 결과

연구 질문

  • RQ1강화학습은 공정 노이즈, 관측 오차, 제어 오차를 포함한 여러 불확실성 원인 하에서 강건한 저추력 행성간 궤도 설계에 효과적으로 기여할 수 있는가?
  • RQ2결정론적이고 외란이 없는 상황에서 PPO로 훈련된 정책의 성능은 간접 최적 제어 해법과 어떻게 비교되는가?
  • RQ3누락된 추력 이벤트와 같은 확률적 외란 하에서 학습된 정책이 종단 제약 조건 준수율과 페이로드 질량 효율성을 어느 정도 유지하는가?
  • RQ4누락된 추력 이벤트의 발생 시점이 정책의 복구 능력과 임무 목표 달성 능력에 어떤 영향을 미치는가?
  • RQ5제안된 RL 프레임워크는 가우시안 외란을 초월한 다양한 확률적 동역학 모델과 다른 행성간 임무로 일반화될 수 있는가?

주요 결과

  • 결정론적 시나리오에서 PPO 정책는 간접 방법으로 계산된 최적 궤도와 매우 유사한 해를 도출하여, 접근법의 정확성을 검증하였다.
  • 상태 및 관측 불확실성 하에서는 종단 제약 조건을 충족시키는 데 성공률이 0%에 머물러, 상태 추정 오차에 매우 민감함을 나타냈다.
  • 추력 크기 및 방향의 제어 불확실성에 대해서는 성공률이 8%였으며, 다중 누락된 추력 이벤트의 경우 16.8%, 단일 이벤트의 경우 18.8%로 중간 정도의 내구성을 보였다.
  • 단일 MTE의 69.8%와 다중 MTE의 70.4%에서 정책은 완전한 추력 손실 상황에서 성공적으로 복구되었지만, 종료 시간 근처에서 MTE가 발생할 경우 충분한 ΔV 보상이 이루어지지 않아 실패가 발생했다.
  • 제약 위반 증가율이 높은 시나리오에서는 최종 우주선 질량이 증가하여, 제약 조건 준수 실패는 연료 낭비와 함께 페이로드 질량 감소를 초래함을 시사했다.
  • 제약 위반과 질량 결과의 높은 변동성은 MTE 발생 시점의 중요성과 RL 기반 가이던스에서 제약 조건 처리 메커니즘 향상의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.