Skip to main content
QUICK REVIEW

[논문 리뷰] Autonomous Six-Degree-of-Freedom Spacecraft Docking Maneuvers via Reinforcement Learning

Charles Oestreich, Richard Linares|arXiv (Cornell University)|2020. 08. 07.
Space Satellite Systems and Control참고 문헌 23인용 수 10
한 줄 요약

이 논문은 보조 정책 최적화(PPO)를 기반으로 한 강화학습 기반 정책을 제안하여 6-자유도(6-DOF) 우주선 도킹을 위한 자율적 제어를 구현한다. 이는 저연산 비용의 피드백 제어를 가능하게 하며, 우주선 도킹의 안정성과 효율성을 확보한다. 이 방법은 아폴로 이행 및 도킹 시나리오의 시뮬레이션 환경에서 도킹 정책을 성공적으로 학습하였으며, 최적 제어 성능과 유사한 성능을 달성하면서도 불확실성과 제약 조건을 최소한의 비최적성으로 처리한다.

ABSTRACT

A policy for six-degree-of-freedom docking maneuvers is developed through reinforcement learning and implemented as a feedback control law. Reinforcement learning provides a potential framework for robust, autonomous maneuvers in uncertain environments with low on-board computational cost. Specifically, proximal policy optimization is used to produce a docking policy that is valid over a portion of the six-degree-of-freedom state-space while striving to minimize performance and control costs. Experiments using the simulated Apollo transposition and docking maneuver exhibit the policy's capabilities and provide a comparison with standard optimal control techniques. Furthermore, specific challenges and work-arounds, as well as a discussion on the benefits and disadvantages of reinforcement learning for docking policies, are discussed to facilitate future research. As such, this work will serve as a foundation for further investigation of learning-based control laws for spacecraft proximity operations in uncertain environments.

연구 동기 및 목표

  • 불확실한 환경에서 안정적이고 자율적인 6-DOF 도킹 정책 개발
  • 기존 최적 제어 기법이 동적이고 불확실하며 복잡한 제약 조건을 처리하는 데 한계를 보이는 문제 해결
  • 모델-무관 강화학습을 이용한 근접 운항 작업에 있어 낮은 차량 내 연산 부담을 감안한 실현 가능성 입증
  • GPOPS-II를 사용하여 학습된 강화학습 정책과 기존 최적 제어 방법 간의 성능 비교
  • 향후 강화학습 기반 우주선 제어 연구를 위한 핵심 구현 과제 및 대체 방법 기록 및 규명

제안 방법

  • 상태 관측치를 제어 동작으로 매핑하는 정책을 학습하기 위해 보조 정책 최적화(PPO)를 사용하며, 형태가 조정된 보상 함수를 최대화하도록 한다.
  • 전체 상태 공간에서 균형 잡힌 수렴을 보장하고 궤도 지속 시간을 안내하기 위해 LQR 기반 보상 함수를 설계한다.
  • 에피소드 종료 없이 연속적이고 부드러운 충돌 페널티를 적용하여 에이전트가 안전 제약 조건을 위반하는 것을 방지한다.
  • 정책은 실시간 피드백 제어 법칙으로 구현되어 기존 우주선 하드웨어에 저연산 비용으로 구현 가능하다.
  • KL 발산 클리핑 및 학습률과 같은 하이퍼파rameter를 동적으로 조정하여 학습 안정성과 정책 업데이트의 정확성을 유지한다.
  • 고정밀도 시뮬레이션을 통해 아폴로 이행 및 도킹 조작의 상대적 선형 및 회전 운동을 포함한 평가 수행

실험 결과

연구 질문

  • RQ1강화학습이 충돌을 피하고 제어 노력 최소화를 달성하는 안정적이고 일반화 가능한 6-DOF 도킹 정책을 생성할 수 있는가?
  • RQ2비용과 수렴성 측면에서 강화학습 기반 정책의 성능가 기존 최적 제어 방법과 비교해 볼 때 어떻게 다른가?
  • RQ3우주선 도킹을 위한 강화학습 정책 학습 시 주요 과제는 무엇이며, 이를 어떻게 완화할 수 있는가?
  • RQ4강화학습 정책는 우주선 시스템에 적합한 낮은 차량 내 연산 비용으로 구현 가능한가?
  • RQ5보상 형태 조정이 원하는 궤도 프로파일과 도착 시간 도달을 안내하는 데 얼마나 효과적인가?

주요 결과

  • PPO 기반 정책는 아폴로 이행 및 도킹 시나리오의 시뮬레이션 환경에서 충돌 없이 6-DOF 도킹을 성공적으로 달성하였으며, 상태 공간의 일부에서 안정성을 입증하였다.
  • GPOPS-II 소프트웨어 스위트가 생성한 최적 해와 비교해 2.5% 이내의 성능 차이를 보이며, 최소한의 손실로 높은 비최적성 수준을 달성하였다.
  • 에피소드 종료 없이 연속적인 충돌 페널티를 적용함으로써, 일부 이전 강화학습 설정에서와 달리 에이전트가 안전 제약 조건을 위반하는 것을 방지하였다.
  • KL 발산 클리핑 및 학습률의 동적 조정이 학습 안정성을 확보하고, 고분산 탐색 단계에서 정책 붕괴를 방지하였다.
  • LQR 기반 항목이 포함된 보상 형태 조정을 통해 상태 공간 전반에서 일관된 수렴과 궤도 지속 시간 제어 향상을 달성하였지만, 목표 시간은 완벽하게 달성하지 못하였다.
  • 정책은 중간 수준의 연산 자원만 소비하여 현재 우주선 항법 장치에서 실시간 구현 가능성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.