Skip to main content
QUICK REVIEW

[논문 리뷰] Data-Driven Recovery of Optimal Feedback Laws through Optimality Conditions and Sparse Polynomial Regression

Behzad Azmi, Dante Kalise|arXiv (Cornell University)|2020. 07. 19.
Model Reduction and Neural Networks참고 문헌 49인용 수 5
한 줄 요약

이 논문은 높은 차원의 최적 피드백 법칙을 계산하기 위해 데이터 기반 방법을 제안한다. 이를 위해 페트리아코프의 최대원리(Pontryagin's Maximum Principle)를 표현 공식으로 활용하여 상태-가치 쌍과 기울기 값을 생성하고, LASSO 회귀를 통해 희소 다항식 모델을 피팅한다. 이 방법은 훈련 샘플 수요를 줄이고 기울기 데이터를 포함할 경우 더 낮은 복잡도의 피드백 법칙을 도출한다.

ABSTRACT

A data-driven approach for the computation of high-dimensional optimal feedback laws arising in deterministic nonlinear control is proposed. The approach exploits the control-theoretical link between Hamilton-Jacobi-Bellman PDEs characterizing the value function of the optimal control problems, and first-order optimality conditions via Pontryagin's Maximum Principle. The latter is used as a representation formula to recover the value function and its gradient at arbitrary points in the space-time domain through the solution of a two-point boundary value problem. After generating a dataset consisting of different state-value pairs, a hyperbolic cross polynomial model for the value function is fitted using a LASSO regression. An extended set of low and high-dimensional numerical tests in nonlinear optimal control reveal that enriching the dataset with gradient information reduces the number of training samples, and that the sparse polynomial regression consistently yields a feedback law of lower complexity.

연구 동기 및 목표

  • 고차원 비선형 제어 문제에서 최적 피드백 법칙을 계산하기 위한 확장 가능한 데이터 기반 접근법을 개발한다.
  • 해밀토니안-자코비-벨리만 편미분방정식(Pontryagin의 최대원리) 간의 연관성을 활용하여 가치 함수를 효율적으로 복원한다.
  • LASSO 정규화를 사용한 희소 다항식 회귀를 통해 피드백 법칙의 복잡도를 감소시킨다.
  • 훈련 데이터 세트에 기울기 정보를 포함시키는 것이 표본 효율성과 모델 복잡도에 미치는 영향을 조사한다.

제안 방법

  • 두 지점 경계값 문제의 수치적 해법을 통해 임의의 상태-시간 점에서 가치 함수와 그 기울기를 페트리아코프의 최대원리를 이용해 계산한다.
  • 두 지점 경계값 문제의 수치적 해를 통해 상태-가치 쌍과 해당 기울기 값을 포함한 데이터 세트를 생성한다.
  • 고차원 공간에서 가치 함수를 표현하기 위해 하이퍼볼릭 크로스 다항식 기저를 구성한다.
  • LASSO 회귀를 적용하여 데이터 세트에 대해 희소 다항식 모델을 피팅하고, 낮은 복잡도의 해를 촉진한다.
  • 표본 효율성과 모델 정확도 향상을 위해 훈련 데이터 세트에 기울기 정보를 보완한다.
  • 다양한 저차원 및 고차원 비선형 최적 제어 문제에 대해 방법을 검증한다.

실험 결과

연구 질문

  • RQ1고차원 제어 문제에서 피드백 법칙 근사의 훈련 데이터 생성에 있어 페트리아코프의 최대원리를 어떻게 활용할 수 있는가?
  • RQ2훈련 데이터 세트에 기울기 정보를 포함시키는 것이 필요한 표본 수에 어떤 영향을 미치는가?
  • RQ3LASSO를 사용한 희소 다항식 회귀는 비선형 시스템에서 최적 피드백 법칙의 구조를 효과적으로 포착할 수 있는가?
  • RQ4기울기 데이터의 포함이 도출된 피드백 법칙의 희소성과 복잡도에 어떤 영향을 미치는가?
  • RQ5제안된 방법이 고차원 최적 제어 문제에 얼마나 잘 스케일링되는가?

주요 결과

  • 훈련 데이터 세트에 기울기 정보를 포함시키면 정확한 피드백 법칙 근사에 필요한 표본 수가 크게 감소한다.
  • 희소 다항식 회귀 모델은 밀도 모델 대비 항상 더 낮은 복잡도의 피드백 법칙을 도출한다.
  • 이 방법은 저차원 및 고차원 비선형 최적 제어 문제 전반에서 정확한 피드백 법칙 복원을 달성한다.
  • 하이퍼볼릭 크로스 다항식 기저의 사용은 고차원 가치 함수의 효과적인 근사화를 가능하게 한다.
  • 기울기 데이터를 훈련 과정에 통합할 경우 표본 효율성과 모델 희소성이 향상됨을 보여준다.
  • 이 방법을 통해 도출된 피드백 법칙은 계산적으로 효율적이며 실시간 구현에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.