Skip to main content
QUICK REVIEW

[논문 리뷰] Hamilton-Jacobi-Bellman Equations for Maximum Entropy Optimal Control

Jeongho Kim, Insoon Yang|arXiv (Cornell University)|2020. 09. 28.
Adaptive Dynamic Programming Control참고 문헌 59인용 수 5
한 줄 요약

이 논문은 엔트로피 정규화를 통한 연속시간 결정론적 최적 제어 문제를 위한 새로운 유형의 해밀턴-자코비-벨리만(HJB) 방정식을 제안하며, 최적 가치 함수가 유일한 점성 해석임을 증명한다. 일반화된 호프-래그 공식을 통해 계산의 실현 가능성을 확보하고, 제어-아핀 시스템의 경우 최적 제어가 가우시안 분포가 됨을 보이며, 선형-제곱형의 경우 리카티 방정식으로 감소함으로써, 최초로 데이터 기반, 정보 이론 기반의 연속시간 탐색을 가능하게 한다.

ABSTRACT

Maximum entropy reinforcement learning (RL) methods have been successfully applied to a range of challenging sequential decision-making and control tasks. However, most of existing techniques are designed for discrete-time systems. As a first step toward their extension to continuous-time systems, this paper considers continuous-time deterministic optimal control problems with entropy regularization. Applying the dynamic programming principle, we derive a novel class of Hamilton-Jacobi-Bellman (HJB) equations and prove that the optimal value function of the maximum entropy control problem corresponds to the unique viscosity solution of the HJB equation. Our maximum entropy formulation is shown to enhance the regularity of the viscosity solution and to be asymptotically consistent as the effect of entropy regularization diminishes. A salient feature of the HJB equations is computational tractability. Generalized Hopf-Lax formulas can be used to solve the HJB equations in a tractable grid-free manner without the need for numerically optimizing the Hamiltonian. We further show that the optimal control is uniquely characterized as Gaussian in the case of control affine systems and that, for linear-quadratic problems, the HJB equation is reduced to a Riccati equation, which can be used to obtain an explicit expression of the optimal control. Lastly, we discuss how to extend our results to continuous-time model-free RL by taking an adaptive dynamic programming approach. To our knowledge, the resulting algorithms are the first data-driven control methods that use an information theoretic exploration mechanism in continuous time.

연구 동기 및 목표

  • 최대 엔트로피 강화 학습을 이산 시간에서 연속 시간 결정론적 최적 제어 문제로 확장하기 위해.
  • 연속 시간 시스템에 대해 엔트로피 정규화를 통합한 새로운 유형의 해밀턴-자코비-벨리만(HJB) 방정식을 유도하기 위해.
  • 유도된 HJB 방정식의 최적 가치 함수가 유일한 점성 해석임을 증명하기 위해.
  • 엔트로피 정규화가 점점 줄어들게 될 때의 渐近 일致성을 확보하여, 극한에서 표준 최적 제어 문제로 복원됨을 보장하기 위해.
  • 일반화된 호프-래그 공식과 선형-제곱형 및 제어-아phin 시스템에 대한 명시적 해를 통해 계산의 실현 가능성을 보장하기 위해.

제안 방법

  • 엔트로피 정규화를 통한 연속 시간 결정론적 시스템에 대해 동적 프ogramming 원리를 적용하여 HJB 방정식을 유도한다.
  • 랜덤화된 제어 입력을 결정론적 시스템에 모델링하기 위해 완화된 제어 포지션을 사용한다.
  • 표준 해밀턴안을 일반화하는 소프트맥스 유사 해밀턴안을 유도하며, 이는 소프트 Q-러닝 아키텍처와 유사하다.
  • 일반화된 호프-래그 공식을 사용하여 해밀턴안 최적화 없이도 그리드 없는 수치적으로 효율적인 방식으로 HJB 방정식을 해석한다.
  • 제어-아핀 시스템의 경우 최적 제어가 표준 최적 제어의 평균을 가진 가우시안 분포로 유일하게 특징지어짐을 증명한다.
  • 선형-제곱형 문제의 경우 HJB 방정식을 대수 Riccati 방정식으로 감소시켜 명시적 최적 제어 표현을 가능하게 한다.

실험 결과

연구 질문

  • RQ1최대 엔트로피 원리가 연속 시간 결정론적 최적 제어 문제에 의미 있게 확장될 수 있는가?
  • RQ2엔트로피 정규화를 통한 연속 시간에서의 동적 프로그래밍 원리는 어떻게 수정될 수 있는가?
  • RQ3엔트로피 정규화 하에서 연속 시간 시스템의 최적 제어의 구조는 어떠한가?
  • RQ4최대 엔트로피 공식화 하에서 가치 함수의 정규성(regularity)은 어떻게 향상되는가?
  • RQ5유도된 HJB 방정식은 계산적으로 실현 가능하고 그리드 없는 방식으로 해석될 수 있는가?

주요 결과

  • 최대 엔트로피 제어 문제의 최적 가치 함수는 유도된 HJB 방정식의 유일한 점성 해석이다.
  • 점성 해석은 정규성을 향상시키며, 하부 및 상부 도함수는 각각 최대 한 개의 원소만 포함한다.
  • 온도 매개변수 α → 0일 때 가치 함수는 표준 최적 제어 문제의 가치 함수로 균일 수렴하며, 渐近 일치성을 확인한다.
  • 제어-아핀 시스템의 경우 최적 제어는 평균이 표준 최적 제어와 일치하는 유일한 가우시안 분포로 특징지어진다.
  • 선형-제곱형 문제의 경우 HJB 방정식은 대수 Riccati 방정식으로 감소하며, 명시적 해석적 해를 가능하게 한다.
  • 일반화된 호프-래그 공식은 해밀턴안 최적화 없이도 HJB 방정식의 그리드 없는 수치적 해석을 가능하게 하여 계산의 실현 가능성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.