Skip to main content
QUICK REVIEW

[논문 리뷰] Trajectory Optimization Algorithm Studies

Manan Gandhi|arXiv (Cornell University)|2015. 06. 02.
Spacecraft Dynamics and Control참고 문헌 2인용 수 3
한 줄 요약

이 논문은 비선형 동역학 시스템에서 궤적 최적화를 위해 미분 동적 프로그래밍(DDP)과 가우스 가짜스펙트럴 최적 제어(GPOC)를 비교한다. DDP는 국소적 2차 근사에 기반해 제어 시퀀스를 반복적으로 개선하기 위해 전진-후진 단계를 사용한다. 반면 GPOC는 레지스터-가우스-로바토 콜로케이션을 사용해 최적 제어 문제를 비선형 프로그래밍으로 변환한다. 짧은 수평선에서는 DDP가 더 낮은 제어 노력과 더 빠른 수렴을 달성하지만, 더 긴 수평선에서는 GPOC가 더 효율적이지만 문제의 깊은 구조적 통찰이 필요하다.

ABSTRACT

In complex engineered systems, completing an objective is sometimes not enough. The system must be able to reach a set performance characteristic, such as an unmanned aerial vehicle flying from point A to point B, extit{under 10 seconds}. This introduces the notion of optimality, what is the most efficient, the fastest, the cheapest way to complete a task. This report explores the two pillars of optimal control, Bellman's Dynamic Programming and Pontryagin's Maximum Principle, and compares implementations of both theories onto simulated systems. Dynamic Programming is realized through a Differential Dynamic Programming Algorithm, where utilizes a forward-backward pass to iteratively optimize a control sequence and trajectory. The Maximum Principle is realized via Gauss Pseudospectral Optimal Control, where the optimal control problem is first approximated through polynomial basis functions, then solved, with optimality being achieved through the costate equations of the Maximum Principle. The results of the report show that, for short time Horizons, DDP can optimize quickly and can generate a trajectory that utilizes less control effort for the same problem formulation. On the other hand Pseudospectral methods can optimize faster for longer time horizons, but require a key understanding of the problem structure. Future work involves completing an implementation of DDP in a C++ code, and testing the speed of convergence for both methods, as well as extended the Pseudospectral Optimal Control framework in to the world of stochastic optimal control.

연구 동기 및 목표

  • 복잡한 동적 및 대수적 제약 조건 하에서 최적 제어 문제를 해결하는 데 있어 미분 동적 프로그래밍(DDP)과 가우스 가짜스펙트럴 최적 제어(GPOC)의 성능을 비교하기.
  • 다양한 시간 수평선에서 계산 속도, 수렴 속도, 제어 노력의 최적성 간의 상충 관계 평가하기.
  • 이격화 시간 간격, 비용 함수 가중치, 문제 구조에 대한 각 방법의 민감도 평가하기.
  • DDP와 GPOC를 확률적 최적 제어 및 접촉 역학으로 확장하는 가능성 탐색하기.
  • 이중 카트폴과 퀴드로터 시스템을 기준으로 두 방법을 검증하기: 실제 상태 및 제어 제약 조건을 포함한 시스템

제안 방법

  • 노멀 트레이젝터리 주변에서 역학과 비용 함수를 선형화하고 피드백 이득 및 개선된 제어 시퀀스를 계산하기 위해 전진-후진 반복 기법을 사용해 DDP를 구현한다.
  • 연속적인 최적 제어 문제를 레지스터-가우스-로바토 콜로케이션 점을 사용해 비선형 프로그래밍으로 변환함으로써 가우스 가짜스펙트럴 최적 제어(GPOC)를 적용한다.
  • DDP의 이론적 기초로 해밀턴-자코비-벨만 방정식을 사용하고, 동적 프로그래밍을 통해 최적성의 필요 조건을 유도한다.
  • GPOC의 최적성 조건을 안내하기 위해 본트리아긴의 최대 원리로부터 코스테이트 방정식을 유도한다.
  • 시간 수평선을 고정 간격으로 이격화하고, 기울기 기반 최적화를 사용해 순차적 2차 프로그래밍(SQP) 솔버를 통해 두 방법 모두를 풀이한다.
  • 상태 및 제어 제약 조건을 두 프레임워크에 통합하기 위해 경계 조건을 설정하고 비용 함수에 페널티 항을 사용한다.

실험 결과

연구 질문

  • RQ1짧은 수평선 최적 제어 문제에서 DDP와 GPOC의 수렴 속도와 최종 비용 측면에서의 비교는 어떻게 되는가?
  • RQ2다양한 시간 수평선에서 DDP와 GPOC를 사용할 경우, 제어 노력과 계산 시간 사이의 상충 관계는 어떠한가?
  • RQ3DDP와 GPOC는 시간 간격 이격화 크기와 비용 함수 가중치 파rameter에 얼마나 민감한가?
  • RQ4특히 제어 노력과 궤적의 매끄러움 측면에서 DDP가 GPOC를 초월하는 상황는 어떤 경우인가?
  • RQ5제어 노력이 가중치가 부여된 상황에서, 더 긴 계산 시간을 감수하더라도 GPOC가 DDP보다 더 높은 해의 품질을 달성할 수 있는가?

주요 결과

  • 이중 카트폴 시스템에서 DDP는 59초 만에 최종 비용 0.3632를 달성했고, GPOC는 15초 만에 더 낮은 비용 0.187을 기록하여 제어 노력이 가중치가 부여된 상황에서 GPOC의 더 뛰어난 최적성의 가능성을 보여주었다.
  • DDP는 펜듈럼을 들어 올리기 위해 전체 4초 수평선을 활용한 반면, GPOC는 더 빨리 목표에 도달했고 상태의 편차를 낮게 유지하여 조기 수렴을 활용할 수 있는 능력을 반영했다.
  • 쿼드로터 실험에서 DDP는 41초 만에 비용 44.6182로 수렴했고, GPOC는 18초 만에 비용 47.9891로 수렴하여 GPOC가 더 빠른 런타임을 보였지만 비용은 더 높았다.
  • GPOC는 특히 쿼드로터 케이스에서 DDP보다 더 높은 최대 및 최소 제어 입력을 보였으며, 이는 목표에 더 빨리 도달하기 위해 더 높은 제어 활동을 보였음을 시사한다.
  • DDP는 시간 간격 크기와 비용 함수 가중치에 매우 민감했고, 목표 상태 정확히 수렴하지 못하는 경우가 많았지만, GPOC는 더 강력하게 정확한 최종 상태 제약 조건을 준수했다.
  • DDP의 비용 궤적은 최적화 과정에서 진동을 보였는데, 이는 반복적인 정책 개선 과정을 반영한 것이며, 반면 GPOC의 비용은 단조롭게 감소하여 안정적인 수렴을 나타냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.