Skip to main content
QUICK REVIEW

[논문 리뷰] Q-learning for Optimal Control of Continuous-time Systems

Biao Luo, Derong Liu|arXiv (Cornell University)|2014. 10. 11.
Adaptive Dynamic Programming Control참고 문헌 42인용 수 7
한 줄 요약

이 논문은 실제 시스템 데이터를 사용하여 일반적인 비선형 연속시간 시스템의 최적 제어를 위한 모델 프리 Q-학습 알고리즘 두 가지—정책 반복 기반 QL(PIQL)과 값 반복 기반 QL(VIQL)—을 제안한다. 연속시간 Q-함수를 도입하고 파arameter 업데이트에 가중 잔여법을 적용함으로써, 두 알고리즘은 오프라인에서 최적 제어 정책으로 수렴하며, 시뮬레이션 결과는 비선형 및 선형 시스템에서의 수렴성과 효과성을 확인한다.

ABSTRACT

In this paper, two Q-learning (QL) methods are proposed and their convergence theories are established for addressing the model-free optimal control problem of general nonlinear continuous-time systems. By introducing the Q-function for continuous-time systems, policy iteration based QL (PIQL) and value iteration based QL (VIQL) algorithms are proposed for learning the optimal control policy from real system data rather than using mathematical system model. It is proved that both PIQL and VIQL methods generate a nonincreasing Q-function sequence, which converges to the optimal Q-function. For implementation of the QL algorithms, the method of weighted residuals is applied to derived the parameters update rule. The developed PIQL and VIQL algorithms are essentially off-policy reinforcement learning approachs, where the system data can be collected arbitrary and thus the exploration ability is increased. With the data collected from the real system, the QL methods learn the optimal control policy offline, and then the convergent control policy will be employed to real system. The effectiveness of the developed QL algorithms are verified through computer simulation.

연구 동기 및 목표

  • 정확한 시스템 모델이 확보되지 않은 일반적인 비선형 연속시간 시스템에 대한 모델 프리 최적 제어 문제를 해결하기 위해.
  • 기존 이산시간 마르코프 결정 과정에서의 Q-학습을 새로운 Q-함수 설정을 통해 비선형 연속시간 시스템으로 확장하기 위해.
  • 시스템의 수학적 모델이 필요 없이 임의의 시스템 데이터로부터 최적 제어 정책을 학습할 수 있는 오프정책 강화학습 알고리즘을 개발하기 위해.
  • 연속시간 최적 제어 맥락에서 PIQL 및 VIQL 방법의 수렴 이론을 수립하기 위해.
  • 비선형 시스템과 선형 F-16 항공기 모델에 대한 시뮬레이션을 통해 제안된 알고리즘을 검증하기 위해.

제안 방법

  • 최적 제어를 위한 연속시간 Q-함수를 도입하여 Q-학습이 연속시간 시스템에 적용될 수 있도록 한다.
  • 최적 Q-함수로 수렴하는 비감소 Q-함수 수열을 생성하는 정책 반복 기반 QL(PIQL) 및 값 반복 기반 QL(VIQL) 알고리즘을 개발한다.
  • 기저 함수를 사용한 Q-함수 근사에 대한 파arameter 업데이트 규칙을 유도하기 위해 가중 잔여법(MWR)을 적용한다.
  • 상태 변수의 다항식과 같은 기저 함수 벡터를 사용한 Q-함수의 파라미터 근사 표현을 통해 제어 정책을 표현한다.
  • 오프정책 학습을 활용하여 시스템 데이터를 임의로 수집할 수 있도록 하여 탐색을 향상시키고 오프라인 정책 학습을 가능하게 한다.
  • 선형 파라미터화 하에서 폐쇄형 업데이트 규칙을 유도함으로써 선형 제곱조절기(LQR) 문제에 대한 두 알고리즘의 단순화를 수행한다.

실험 결과

연구 질문

  • RQ1알려진 시스템 모델이 없이도 Q-학습이 비선형 연속시간 시스템으로 효과적으로 확장될 수 있는가?
  • RQ2실제 시스템 데이터로 훈련된 PIQL 및 VIQL 알고리즘이 최적 제어 정책으로 수렴하는가?
  • RQ3가중 잔여법을 사용하여 연속시간 시스템에서 Q-함수 근사에 대한 안정적이고 수렴 가능한 파arameter 업데이트 규칙을 유도할 수 있는가?
  • RQ4비선형 최적 제어 문제에서 수렴 속도와 정확도 측면에서 PIQL과 VIQL 간의 성능 차이는 무엇인가?
  • RQ5제안된 QL 방법은 비선형 및 선형 연속시간 시스템, 실세계 항공기 모델을 포함한 실제 시스템에 성공적으로 적용될 수 있는가?

주요 결과

  • 비선형 시스템 예제에서 PIQL 알고리즘은 7회 반복 후 최적 제어 정책으로 수렴하며, 제어 이득 $ K^{(7)} = [0.0067~{}~{}-0.0009~{}~{}-0.0112~{}~{}-0.9860~{}~{}-0.0076] $ 를 도출하여 이상적인 최적 이득 $ K = [0~{}~{}0~{}~{}0~{}~{}-1~{}~{}0] $ 과 밀도적으로 유사하게 근사한다.
  • VIQL 알고리즘은 390회 반복 후 수렴하여 제어 이득 $ K^{(390)} = [0.0055~{}~{}0.0016~{}~{}-0.0130~{}~{}-0.9813~{}~{}-0.0117] $ 를 달성하며, 최적 값과 유사한 결과를 보인다.
  • 두 알고리즘 모두 비선형 시스템에서 폐쇄형 루프 비용 0.0150을 달성하여 최소 비용으로 효과적인 성능을 보였다.
  • PIQL 및 VIQL 하에서 상태 및 제어 신호의 폐쇄형 루프 궤적은 거의 동일하며 안정적이며, 이는 강건성과 수렴성을 확인한다.
  • LQR 문제의 경우 단순화된 PIQL 및 VIQL 알고리즘이 분석적 해에 정확히 수렴함으로써 이론적 프레임워크의 타당성을 검증하였다.
  • 시뮬레이션 결과는 PIQL 및 VIQL가 시스템 모델이 필요 없이 실제 시스템 데이터로부터 최적 제어 정책을 학습할 수 있는 효과적인 오프정책 학습 방법임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.