Skip to main content
QUICK REVIEW

[논문 리뷰] Online Approximate Optimal Path-Following for a Kinematic Unicycle

Patrick Walters, Rushikesh Kamalapurkar|arXiv (Cornell University)|2013. 09. 30.
Adaptive Dynamic Programming Control참고 문헌 30인용 수 4
한 줄 요약

이 논문은 동시 학습 기반 적응 법칙을 사용한 근사 동적 프rogramming(ADP)을 활용하여 운동학적 투호기의 온라인 근사 최적 경로 추종 제어기를 제안한다. 경로에 대한 가상의 목표점의 진행 방식을 재정의하여 상태 도메인을 유한하게 유지하고, 경로 진행도를 제외한 수정된 비용 함수를 정의함으로써, 무한 시간 최적 제어 정책의 안정적인 온라인 근사가 가능해지며, 차량이 경로로 향하는 것과 근사 정책이 최적 정책으로 수렴하는 데 대해 균일하게 궁극적으로 유계(UUB) 수렴 보장이 가능하다.

ABSTRACT

Online approximation of an infinite horizon optimal path-following strategy for a kinematic unicycle is considered. The solution to the optimal control problem is approximated using an approximate dynamic programming technique that uses concurrent-learning-based adaptive update laws to estimate the unknown value function. The developed controller overcomes challenges with the approximation of the infinite horizon value function using an auxiliary function that describes the motion of a virtual target on the desired path. The developed controller guarantees uniformly ultimately bounded (UUB) convergence of the vehicle to a desired path while maintaining a desired speed profile and UUB convergence of the approximate policy to the optimal policy. Simulation results are included to demonstrate the controller's performance.

연구 동기 및 목표

  • 지속적인 자극 조건이 필요하지 않은 온라인 실시간 최적 경로 추종 제어기를 개발하기 위해.
  • 일정한 제어 노력으로 인해 비유한 비용이 발생하고 경로 매개변수의 유계가 아닌 특성으로 인해 발생하는 무한 시간 경로 추종 제어 문제의 부적절한 성질을 해결하기 위해.
  • 신경망을 사용하여 유한 도메인에서 최적 값 함수와 정책의 안정적인 온라인 근사를 가능하게 하기 위해.
  • 차량이 목표 경로로 향하는 데 대해 균일하게 궁극적으로 유계(UUB) 수렴을 보장하면서 동시에 목표 속도 프로파일을 유지하기 위해.
  • 상태 및 정책 근사 오차에 대해 라플라스 기반 분석을 통해 이론적 안정성 보장을 확보하기 위해.

제안 방법

  • 경로를 따라 움직이는 가상의 목표점의 운동을 상태에 따라 결정되는 상미방정식(ODE)으로 정의하고, 이를 재정의하여 관련 상태가 유한 도메인 내에 유지되도록 하였다.
  • 투호기와 가상의 목표점 사이의 운동학적 오차 동역학을 자율 시스템으로 정의함으로써, 무한 시간 최적 제어 문제의 분석이 가능하도록 하였다.
  • 설계된 제어 입력과 경로 유지에 필요한 노미널 제어 입력의 차이로 정의된 수정된 제어 입력을 통해 경로 진행도와 비용을 분리하였다.
  • 가상의 목표점의 위치를 제외한 비용 함수를 재정의함으로써 유한한 비용을 보장하고, 잘 정의된 최적 제어 문제를 가능하게 하였다.
  • 신경망을 사용하여 값 함수와 정책을 근사하는 근사 동적 프로그래밍(ADP) 프레임워크를 적용하였으며, 동시 학습 기반 경사 하강법을 사용하여 온라인 적응을 수행하였다.
  • 라플라스 기반 안정성 분석을 통해 차량 상태가 경로로 향하는 것과 근사 정책이 최적 정책으로 수렴하는 데 대해 균일하게 궁극적으로 유계(UUB) 수렴이 증명되었다.

실험 결과

연구 질문

  • RQ1지속적인 자극 조건이 필요하지 않은 운동학적 투호기의 무한 시간 최적 경로 추종 제어기의 온라인 근사를 개발할 수 있는가?
  • RQ2최적 값 함수 근사에서 유한하지 않은 경로 매개변수를 어떻게 변환하여 신경망 근사에 적합한 유한 도메인을 확보할 수 있는가?
  • RQ3일정한 제어 노력이 필요로 하는 경로 추종 유지를 위해 어떤 제어 구조가 유한한 비용과 안정적인 경로 추종을 가능하게 하는가?
  • RQ4보장된 수렴 성질을 갖는 적응 학습을 통해 실시간으로 최적 정책을 어떻게 근사할 수 있는가?
  • RQ5차량 상태와 근사 정책이 최적 해로 수렴하는 데 대해 어떤 이론적 보장을 제공할 수 있는가?

주요 결과

  • 제안된 제어기는 목표 속도 프로파일을 유지하면서 차량 상태가 목표 경로로 향하는 데 대해 균일하게 궁극적으로 유계(UUB) 수렴을 보장한다.
  • 라플라스 기반 안정성 분석을 통해 근사 정책이 최적 정책으로 균일하게 궁극적으로 유계(UUB) 수렴함을 증명하였다.
  • 시뮬레이션 결과는 ADP 기반 제어기가 오프라인 GPOPS 최적 해법으로부터 얻은 해와 유사한 상태 및 제어 궤적을 생성하는 것으로 나타났다.
  • 신경망 가중치 추정치가 안정된 상태값으로 수렴함을 보여주어 안정적인 학습과 정책 근사가 이루어지고 있음을 시사한다.
  • 제어 성능은 값 함수 근사에 사용된 기저 함수의 선택에 민감하며, 선형 기저 함수는 경로 근처에서 양호한 국소 근사를 제공한다.
  • 이 방법은 적응 학습 법칙에서 지속적인 자극 조건이 필요 없음을 해결하여 최적 제어기의 실시간 온라인 근사를 성공적으로 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.