Skip to main content
QUICK REVIEW

[논문 리뷰] Approximating the Stationary Hamilton-Jacobi-Bellman Equation by Hierarchical Tensor Products

Mathias Oster, Leon Sallandt|arXiv (Cornell University)|2019. 11. 01.
Model Reduction and Neural Networks참고 문헌 2인용 수 12
한 줄 요약

이 논문은 공간 이산화된 비선형 포아송 PDE의 무한수명 최적 제어 문제에서 발생하는 고차원 정적 해밀턴-자코비-벨리만(HJB) 방정식을 해결하기 위해 계층적 텐서 트레일(TT)과 다항식 근사 방법을 제안한다. 정책 반복을 선형 초구형 PDE로 재구성하고, 고차원 적분을 이용한 쿠퍼만 연산자를 적용함으로써 값 함수의 저랭크 근사를 가능하게 하여 黏성 버거 방정식과 슐로글 방정식에서 수렴성과 수치적 안정성을 입증한다.

ABSTRACT

We treat infinite horizon optimal control problems by solving the associated stationary Hamilton-Jacobi-Bellman (HJB) equation numerically, for computing the value function and an optimal feedback area law. The dynamical systems under consideration are spatial discretizations of nonlinear parabolic partial differential equations (PDE), which means that the HJB is suffering from the curse of dimensions. To overcome numerical infeasability we use low-rank hierarchical tensor product approximation, or tree-based tensor formats, in particular tensor trains (TT tensors) and multi-polynomials, since the resulting value function is expected to be smooth. To this end we reformulate the Policy Iteration algorithm as a linearization of HJB equations. The resulting linear hyperbolic PDE remains the computational bottleneck due to high-dimensions. By the methods of characteristics it can be reformulated via the Koopman operator in the spirit of dynamic programming. We use a low rank tensor representation for approximation of the value function. The resulting operator equation is solved using high-dimensional quadrature, e.g. Variational Monte-Carlo methods. From the knowledge of the value function at computable samples $x_i$ we infer the function $ x \mapsto v (x)$. We investigate the convergence of this procedure. By controlling destabilized versions of viscous Burgers and Schloegl equations numerical evidences are given.

연구 동기 및 목표

  • 공간 이산화된 비선형 포아송 PDE에 의해 지배되는 무한수명 최적 제어 문제에서 발생하는 차원의 저주를 해결하기 위해.
  • 고차원에서 정적 HJB 방정식의 값 함수를 근사하기 위한 수치적으로 실현 가능한 방법을 개발하기 위해.
  • 특히 텐서 트레일과 다항식을 포함한 저랭크 텐서 형식을 활용하여 매끄러운 값 함수를 효율적으로 표현하기 위해.
  • 정책 반복을 선형 초구형 PDE로 재구성하고, 쿠퍼만 연산자와 고차원 적분을 통해 이를 해결하기 위해.
  • 손상된 黏성 버거 방정식과 슐로글 방정식에 대한 수치 실험을 통해 방법을 검증하기 위해.

제안 방법

  • 정적 HJB 방정식을 정책 반복 과정으로 재구성하여 비선형 HJB를 선형 초구형 PDE의 순차적 시퀀스로 선형화하기.
  • 특성 방법을 적용하여 선형 초구형 PDE를 쿠퍼만 연산자 기반의 진화 방정식으로 변환하기.
  • 값 함수를 계층적 텐서 형식—특히 텐서 트레일(TT)과 다항식—을 사용하여 저랭크 구조를 활용하기.
  • 특정 점에서 값 함수의 표본을 계산하기 위해 고차원 적분 기법(예: 변분 몬테카를로)을 사용하기.
  • 낮은 랭크 텐서 근사를 통해 이산 표본들에서 전역 값 함수 $ x \mapsto v(x) $ 를 추론하기.
  • 손상된 및 안정화된 버거 방정식과 슐로글 방정식의 버전에 적용하여 해의 수치적 안정성을 제어하기.

실험 결과

연구 질문

  • RQ1비선형 포아송 PDE에서 유도된 고차원 HJB 방정식의 값 함수를 효과적으로 근사하기 위해 저랭크 텐서 형식이 유용한가?
  • RQ2쿠퍼만 연산자를 통한 정책 반복의 재구성은 고차원에서 발생하는 선형 초구형 PDE를 안정적이고 효율적으로 해결할 수 있는가?
  • RQ3텐서 트레일 근사를 사용한 고차원 적분 기법이 수렴성과 정확성을 얼마나 잘 유지하는가?
  • RQ4비선형성과 고차원성에도 불구하고 손상된 제어를 가진 비선형 PDE, 예를 들어 黏성 버거 방정식과 슐로글 방정식에 대해 이 방법은 얼마나 잘 작동하는가?
  • RQ5텐서 기반 보간을 통해 계산 가능한 희박한 표본들로부터 값 함수를 정확하게 재구성할 수 있는가?

주요 결과

  • 제안된 방법은 저랭크 텐서 트레일과 다항식을 사용하여 HJB 방정식의 값 함수를 효과적으로 근사함으로써 차원의 저주를 극복한다.
  • 쿠퍼만 연산자를 통한 정책 반복의 재구성은 선형 초구형 PDE에 대한 안정적이고 계산 가능성이 있는 해법 경로를 제공한다.
  • 고차원 적분 기법(예: 변분 몬테카를로)을 통해 고차원 상태 공간에서 값 함수의 정확한 표본 추출이 가능하다.
  • 시험 케이스 전반에 걸쳐 일관된 오차 감소를 보이며 수치적 해법 과정에서 수렴성이 입증된다.
  • 손상된 黏성 버거 방정식과 슐로글 방정식에 대한 수치 실험 결과, 비선형성과 고차원성에도 불구하고 방법이 안정성과 정확성을 유지함을 보였다.
  • 텐서 기반 근사를 통해 표본점들로부터 값 함수가 정확하게 재구성되었으며, 저랭크 표현의 효과성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.