Skip to main content
QUICK REVIEW

[논문 리뷰] Polynomial Approximation of Value Functions and Nonlinear Controller Design with Performance Bounds

Morgan Jones, Matthew M. Peet|arXiv (Cornell University)|2020. 10. 14.
Advanced Optimization Algorithms Research인용 수 5
한 줄 요약

이 논문은 비선형 최적 제어 문제의 값 함수를 해밀턴-자비-벨리만(Hamilton-Jacobi-Bellman, HJB) 편미분방정식의 다항부해결을 통한 다항부해결을 이용해 다항식으로 근사하는 합의제곱(Sum-of-Squares, SOS) 최적화 방법을 제안한다. 다항부해결이 진짜 값 함수로 $L^1$ 노름에서 수렴함을 증명하고, 이러한 근사로부터 유도된 제어기의 부분최적성(sub-optimality)이 진짜 값 함수와의 $W^{1,\infty}$-노름 거리에 의해 유 bounds됨을 보여준다.

ABSTRACT

For any suitable Optimal Control Problem (OCP) there exists a value function, defined as the unique viscosity solution to the Hamilton-Jacobi-Bellman (HJB) Partial-Differential-Equation (PDE), and which can be used to design an optimal feedback controller for the given OCP. In this paper, we approximately solve the HJB-PDE by proposing a sequence of Sum-Of-Squares (SOS) problems, each of which yields a polynomial subsolution to the HJB-PDE. We show that the resulting sequence of polynomial sub-solutions converges to the value function of the OCP in the L1 norm. Furthermore, for each polynomial sub-solution in this sequence, we show that the associated sequence of sublevel sets converge to the sublevel set of the value function of the OCP in the volume metric. Next, for any approximate value function, obtained from an SOS program or any other method (e.g. discretization), we construct an associated feedback controller, and show that sub-optimality of this controller as applied to the OCP is bounded by the distance between the approximate and true value function of the OCP in the Sobolev norm. Finally, we demonstrate numerically that by solving our proposed SOS problem we are able to accurately approximate value functions, design controllers and estimate reachable sets.

연구 동기 및 목표

  • 비선형 최적 제어 문제(OCP)의 값 함수를 다항부해결을 이용해 근사하는 데 convex 최적화 프레임워크를 개발하기.
  • 다항부해결의 수열이 다항식 차수 $d$ 가 증가함에 따라 진짜 값 함수로 $L^1$ 노름에서 수렴함을 확립하기.
  • 이러한 다항근사의 등고선 집합(sublevel sets)이 체적 거리(metric)에서 진짜 등고선 집합으로 수렴함을 보이기.
  • 진짜 값 함수와의 $W^{1,\infty}$-노름 거리에 기반해 근사 값 함수로부터 유도된 제어기의 성능 한계를 유도하기.
  • 수치적으로 이 방법이 정확한 값 함수 근사, 제어기 설계 및 도달가능집합 추정을 가능하게 함을 보여주기.

제안 방법

  • HJB 편미분방정식의 다항부해결을 계산하기 위한 합의제곱(SOS) 최적화 문제의 수열을 설정하기.
  • 각 다항부해결이 다음 부등식 제약 조건을 만족하도록 보장하기: $ \nabla_t V + \inf_{u \in U} \left\{ c(x,u,t) + \nabla_x V^T f(x,u) \right\} \leq 0 $, 종료 조건은 $ V(x,T) = g(x) $.
  • 다항부해결이 다항식 차수 $d$ 가 증가함에 따라 진짜 값 함수로 수렴함을 $L^1$ 노름으로 측정하기.
  • 기하학적 및 측도론적 추론을 통해 다항근사의 등고선 집합이 진짜 등고선 집합으로 체적 거리에서 수렴함을 증명하기.
  • 임의의 후보 값 함수로부터 피드백 제어기를 구성하기 위해 해밀턴함수의 하한을 사용하기: $ k(x,t) \in \arg\inf_{u \in U} \left\{ c(x,u,t) + \nabla_x V^T f(x,u) \right\} $.
  • 근사된 값 함수와 진짜 값 함수의 차이의 $W^{1,\infty}$-노름을 이용해 제어기의 부분최적성에 대한 성능 한계를 도출하기.

실험 결과

연구 질문

  • RQ1다항식 차수 $d$ 가 증가함에 따라, convex SOS 프로그램의 수열이 OCP의 진짜 값 함수로 $L^1$ 노름에서 수렴하는가?
  • RQ2이러한 다항부해결의 등고선 집합이 체적 거리에서 진짜 등고선 집합으로 수렴하는가?
  • RQ3근사 값 함수로부터 유도된 제어기의 부분최적성이 진짜 값 함수와의 $W^{1,\infty}$-노름 거리로 유 bounds될 수 있는가?
  • RQ4이 방법은 루엔츠 애트랙터와 같은 비선형 시스템의 도달가능집합을 보장된 포함성을 갖추고 정확하게 추정할 수 있는가?
  • RQ5$L^1$ 수렴이 엄격한 등고선 집합의 수렴을 암시하는가? 이는 도달가능집합을 특징짓는다.

주요 결과

  • SOS 최적화를 통해 생성된 다항부해결 수열은 다항식 차수 $d$ 가 증가함에 따라 진짜 값 함수로 $L^1$ 노름에서 수렴한다.
  • 다항부해결의 등고선 집합은 $d \to \infty$일 때 진짜 등고선 집합으로 체적 거리에서 수렴한다.
  • 근사 값 함수로부터 유도된 제어기의 부분최적성은 근사 값 함수와 진짜 값 함수의 차이의 $W^{1,\infty}$-노름으로 유 bounds된다.
  • 수치적 결과는 다항식 차수 $d=10$ 으로 SOS 문제를 풀었을 때, $0$-등고선 집합이 루엔츠 애트랙터를 정확하게 추정하고 진짜 전방 도달가능집합을 포함함을 보여준다.
  • 이 방법은 다항부해결의 등고선 집합을 통해 진짜 도달가능집합이 항상 포함됨을 보장하므로 안전성 분석에 매우 중요하다.
  • 반례를 통해 $L^1$ 수렴이 엄격한 등고선 집합의 수렴을 보장하지는 않지만, 실질적으로 오차는 무시할 만큼 작고, 이 방법은 도달가능집합 추정에 있어 여전히 효과적임을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.