Skip to main content
QUICK REVIEW

[논문 리뷰] Local Solutions of the Dynamic Programming Equations and the Hamilton Jacobi Bellman PDE

Carmeliza Navasca|ArXiv.org|2002. 08. 30.
Optimization and Variational Analysis참고 문헌 26인용 수 13
한 줄 요약

이 논문은 무한 시간 최적 제어 문제에서 동적 프rogram밍 방정식(DPE)과 해밀턴-자코비-벨리만(HJB) 편미분방정식(PDE)의 국소적 근사해를 위한 멱급수 방법을 제시한다. 알브레히트(Al'brecht)의 접근을 확장하여 최적 제어와 비용-가시성(cost-to-go)의 형식적 테일러 전개를 각각 차수 $ r-1 $ 및 $ r $까지 계산하고, 국소 안정 다변량정리(Local Stable Manifold Theorem)와 심플렉틱 기하학 도구를 활용하여 이러한 전개와 일치하는 매끄러운 국소 해의 존재성을 증명한다.

ABSTRACT

We present methods for locally solving the Dynamic Programming Equations (DPE) and the Hamilton Jacobi Bellman (HJB) PDE that arise in the infinite horizon optimal control problem. The method for solving the DPE is the discrete time version of Al'brecht's procedure for locally approximating the solution of the HJB. We also prove the existence of the smooth solutions to the DPE that has the same Taylor series expansions as the formal solutions. Our procedure for solving the HJB PDE numerically begins with Al'brecht's local solution as the initial approximation and uses some Lyapunov criteria to piece together polynomial estimates. The polynomials are generated using the method in the Cauchy-Kovalevskaya Theorem.

연구 동기 및 목표

  • 무한 시간 최적 제어 문제에서 최적 제어 및 비용-가시성의 국소 멱급수 근사해를 체계적으로 계산하는 방법을 개발하는 것.
  • 형식적 멱급수 전개와 일치하는 매끄러운 국소 해가 DPE에 존재함을 증명하는 것.
  • HJB PDE에 대한 알브레히트의 방법을 이산 시간 동역학 및 $ \mathcal{C}^r $ 매끄러운 비선형 시스템으로 확장하는 것.
  • 프로트리아고린 최대원리(Pontryagin Maximum Principle), 해밀턴 역학, 비선형 시스템의 국소 안정 다변량 구축 간의 관계를 규명하는 것.
  • 리아파노프 기준과 등고선 절단을 활용한 국소 다항근사해를 간격 간에 접합하는 수치 알고리즘을 제공하는 것.

제안 방법

  • DPE의 형식적 멱급수 해를 유도하기 위해 최적 제어 및 비용-가시성의 계수에 대한 재귀적 방정식 시스템을 차수 $ r-1 $ 및 $ r $까지 순차적으로 풀이한다.
  • 원점 주변에서 최적 제어 $ \pi(x) $ 및 코스테이트 기울기 $ \kappa(x) $의 초기 국소 다항근사해를 알브레히트의 방법을 적용해 계산한다.
  • 프로트리아고린 최대원리를 적용해 정방향 해밀턴 역학을 유도하고 해밀턴 행렬의 고유구조를 분석한다.
  • 국소 안정 다변량정리를 적용해 최적 비용 함수에 대응하는 매끄러운 불변 다변량을 구축함으로써 해의 존재성을 보장한다.
  • 심플렉틱 구조와 스토크스 정리(Stokes’ Theorem)를 활용해 근사 과정에서 해밀턴 시스템의 기하적 성질을 유지한다.
  • 리아파노프 기준을 활용해 국소 근사해를 등고선에서 절단하고 인접한 간격에 새로운 다항근사해를 부착하는 수치적 접합 알고리즘을 개발한다.

실험 결과

연구 질문

  • RQ1비선형 최적 제어 문제에서 $ \mathcal{C}^r $ 동역학 및 비용을 갖는 HJB PDE에 대해 형식적 멱급수 해를 체계적으로 구성할 수 있는가?
  • RQ2주어진 형식적 멱급수 전개와 일치하는 매끄러운 국소 해가 DPE에 존재하기 위한 조건은 무엇인가?
  • RQ3해밀턴 시스템의 국소 안정 다변량은 최적 비용-가시성 함수를 어떻게 특징짓는가?
  • RQ4해밀턴 행렬의 고유구조와 심플렉틱 형식은 국소 해의 존재성과 유일성을 보장하는 데 어떤 역할을 하는가?
  • RQ5리아파노프 기반 절단 및 접합 전략을 통해 국소 다항근사해를 상태공간 전역에 효과적으로 확장할 수 있는가?

주요 결과

  • 논문은 DPE에서 유도된 재귀적 계수 방정식을 활용해 최적 제어와 비용-가시성에 대해 각각 차수 $ r-1 $ 및 $ r $까지 형식적 멱급수 해를 구성한다.
  • 국소 안정 다변량정리를 활용해 형식적 멱급수 전개와 일치하는 매끄러운 국소 해가 DPE에 존재함을 증명한다.
  • 최적 비용 함수가 해밀턴 역학의 안정 다변량에서 유도된 라그랑주 부분다양체의 그래프임을 보여준다.
  • 프라거(Prager) 예제에서 실제 최적 제어 및 비용 함수에 대한 근사가 성공적으로 수행되었으며, 수치 결과는 $ \pi_{\text{new}}(x) $ 및 $ \kappa_{\text{new}}(x) $ 가 진짜 해 $ \pi_* $ 및 $ \kappa_* $로 수렴하는 것을 보여주며, 그림 5.2에서 확인할 수 있다.
  • 알고리즘은 등고선에서 절단하고 재전개하는 방식으로 반복적으로 근사해를 향상시키며, $[0,4]$에서 $ l=4 $까지, $(-1,0]$에서 $ l=3 $까지 수렴이 관찰된다.
  • 해밀턴 행렬의 0이 고유값이어도, 이 고유값이 크기가 1 이하인 안정된 피드백 루프 고유값에 대응하는 한 방법은 여전히 유효하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.