Skip to main content
QUICK REVIEW

[논문 리뷰] Generalized Policy Iteration for Optimal Control in Continuous Time.

Jingliang Duan, Shengbo Eben Li|arXiv (Cornell University)|2019. 09. 11.
Adaptive Dynamic Programming Control참고 문헌 47인용 수 16
한 줄 요약

이 논문은 동역학이 알려진 연속시간 비선형 시스템에서 최적 제어를 위한 새로운 알고리즘인 딥 일반화 정책 반복(Deep Generalized Policy Iteration, DGPI)을 소개한다. 액터-크리틱 프레임워크에서 딥 신경망을 사용함으로써, 적합한 초기 정책이나 입력-압력 시스템 구조가 필요 없이 해밀턴-자코비-벨리만 방정식을 반복적으로 해결함으로써 더 빠른 학습을 위한 느슨한 업데이트 조건으로 최적의 제어 정책으로 수렴한다.

ABSTRACT

This paper proposes the Deep Generalized Policy Iteration (DGPI) algorithm to find the infinite horizon optimal control policy for general nonlinear continuous-time systems with known dynamics. Unlike existing adaptive dynamic programming algorithms for continuous time systems, DGPI does not require the admissibility of initialized policy, and input-affine nature of controlled systems for convergence. Our algorithm employs the actor-critic architecture to approximate both policy and value functions with the purpose of iteratively solving the Hamilton-Jacobi-Bellman equation. Both the policy and value functions are approximated by deep neural networks. Given any arbitrary initial policy, the proposed DGPI algorithm can eventually converge to an admissible, and subsequently an optimal policy for an arbitrary nonlinear system. We also relax the update termination conditions of both the policy evaluation and improvement processes, which leads to a faster convergence speed than conventional Policy Iteration (PI) methods, for the same architecture of function approximators. We further prove the convergence and optimality of the algorithm with thorough Lyapunov analysis, and demonstrate its generality and efficacy using two detailed numerical examples.

연구 동기 및 목표

  • 모든 동역학이 알려진 비선형 연속시간 시스템을 위한 일반적인 최적 제어 프레임워크를 개발한다.
  • 기존 적응 동적 프ogramming 방법에서 요구되는 적합한 초기 정책과 입력-압력 시스템 제약 조건을 제거한다.
  • 정책 평가 및 개선 단계에서의 종료 조건을 완화시켜 수렴 속도를 가속화한다.
  • 엄밀한 리아푸노프 분석을 통해 반복 정책 업데이트 과정의 이론적 수렴성과 최적성 보장한다.
  • 두 가지 복잡한 비선형 시스템에 대한 수치적 검증을 통해 방법의 일반성과 효능을 입증한다.

제안 방법

  • 액터-크리틱 딥 신경망 아키텍처를 사용하여 제어 정책과 가치 함수를 동시에 근사한다.
  • 최적 제어를 위한 해밀턴-자코비-벨리만 방정식을 반복적으로 해결하기 위해 반복 업데이트를 사용한다.
  • 정책 평가 및 개선 단계의 정지 기준을 완화시켜 수렴 속도를 가속화한다.
  • 리아푸노프 기반 분석을 적용하여 반복 정책 업데이트 과정의 수렴성과 최적성을 증명한다.
  • 딥 신경망을 사용하여 연속 시간에서 정책과 가치 함수를 표현한다.
  • 수렴을 위해 시스템이 입력-압력이거나 초기 정책이 적합할 필요가 없다.

실험 결과

연구 질문

  • RQ1딥 강화학습 알고리즘이 입력-압력 구조가 없는 일반적인 비선형 연속시간 시스템에서 최적 제어를 달성할 수 있는가?
  • RQ2제안된 방법은 비적합한 정책으로 초기화되어도 최적의 정책으로 수렴하는가?
  • RQ3정책 반복 과정에서 업데이트 종료 조건을 완화하면 최적성은 유지하면서 수렴 속도를 크게 향상시킬 수 있는가?
  • RQ4일반적인 비선형 동역학 하에서 알고리즘의 수렴성과 최적성이 엄밀히 보장되는가?
  • RQ5속도와 정확도 측면에서 기존 정책 반복 방법과 비교해 볼 때 알고리즘의 성능은 어떠한가?

주요 결과

  • DGPI 알고리즘은 동역학이 알려진 임의의 비선형 연속시간 시스템에 대해 최적의 제어 정책으로 수렴한다.
  • 초기 정책이 적합하지 않더라도 수렴이 보장되어 이전의 적응 동적 프로그래밍 방법의 핵심 한계를 극복한다.
  • 같은 함수 근사 아키텍처를 사용함에도 불구하고, 완화된 업데이트 조건으로 인해 기존 정책 반복보다 더 빠른 수렴 속도를 달성한다.
  • 리아푸노프 분석을 통해 이론적 수렴성과 최적성이 엄밀히 증명된다.
  • 두 가지 세부적인 수치 예제를 통해 강력한 일반성과 효능을 입증한다.
  • 입력-압력 시스템 제약 조건 없이 딥 신경망을 사용하여 해밀턴-자코비-벨리만 방정식을 반복적으로 해결하는 데 성공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.