Skip to main content
QUICK REVIEW

[논문 리뷰] Critic-Only Integral Reinforcement Learning Driven by Variable Gain Gradient Descent for Optimal Tracking Control

Amardeep Mishra, Satadal Ghosh|arXiv (Cornell University)|2019. 11. 11.
Adaptive Dynamic Programming Control참고 문헌 14인용 수 4
한 줄 요약

이 논문은 연속시간 비선형 시스템의 최적 추적 제어를 위해 액추에이터 제약 조건이 있는 비선형 시스템에 대해 비용 함수 기반의 단일 평가자(크리틱) 강화 학습(정규화된 IRL) 프레임워크를 제안한다. HJB 오차와 리아푸노프 도함수의 기반으로 동적 조절 학습률을 적용한 가변 이득 경사 하강법을 도입하여, 초기 안정화 제어기와 이중 근사자 네트워크의 필요성을 제거함으로써 균일 최종 유계성(uniform ultimate boundedness)을 달성하고 잔여 집합을 더욱 좁게 유지한다. 이는 6-DoF UAV 모델을 통해 검증되었다.

ABSTRACT

Integral reinforcement learning (IRL) was proposed in literature to obviate the requirement of drift dynamics in adaptive dynamic programming framework. Most of the online IRL schemes in literature require two sets of neural network (NNs), known as actor-critic NN and an initial stabilizing controller. Recently, for RL-based robust tracking this requirement of initial stabilizing controller and dual-approximator structure could be obviated by using a modified gradient descent-based update law containing a stabilizing term with critic-only structure. To the best of the authors' knowledge, there has been no study on leveraging such stabilizing term in IRL algorithm framework to solve optimal trajectory tracking problems for continuous time nonlinear systems with actuator constraints. To this end a novel update law leveraging the stabilizing term along with variable gain gradient descent in IRL framework is presented in this paper. With these modifications, the IRL tracking controller can be implemented using only critic NN, while no initial stabilizing controller is required. Another salient feature of the presented update law is its variable learning rate, which scales the pace of learning based on instantaneous Hamilton-Jacobi-Bellman error and rate of variation of Lyapunov function along the system trajectories. The augmented system states and NN weight errors are shown to possess uniform ultimate boundedness (UUB) stability under the presented update law and achieve a tighter residual set. This update law is validated on a full 6-DoF nonlinear model of UAV for attitude control.

연구 동기 및 목표

  • 기존의 온라인 IRL 및 ADP 프레임워크에서 최적 추적 제어를 위해 요구되는 초기 안정화 제어기 문제를 해결하기 위해.
  • IRL 기반 최적 추적 제어에서 이중 근사자(액터-크리틱) 아키텍처를 제거하여 계산 부담을 감소시키기 위해.
  • IRL 기반 최적 제어에서 수렴성 향상과 잔여 집합 크기 감소를 위한 학습률 적응 메커니즘을 개발하기 위해.
  • 단일 크리틱 신경망을 사용하여 액추에이터 제약 조건과 부분적인 시스템 지식 하에서 안정성과 강건성을 확보하기 위해.
  • 실제 제어 제약 조건과 동역학을 반영한 완전한 6-DoF 비선형 UAV 모델에서 제안된 방법을 검증하기 위해.

제안 방법

  • HJB 오차의순간적 값과 시스템 궤적을 따라 리아푸노프 함수의 변화율을 기반으로 동적으로 조절되는 학습률을 갖는 가변 이득 경사 하강법을 사용한 새로운 매개변수 갱신 법칙을 설계하였다.
  • 갱신 법칙은 크리틱 전용 아키텍처 내에 안정화 항을 통합하여, 초기 안정화 제어기가 필요 없이 정책 반복을 수행할 수 있도록 하였다.
  • 이 방법은 온-폴리시, 온라인 IRL 프레임워크 내에서 작동하여 탐색 단계를 피하고 실시간 적용 가능성을 확보하였다.
  • 단일 크리틱 신경망이 가치 함수를 근사함으로써 기존의 액터-크리틱 이중 신경망 아키텍처를 대체하여 계산 복잡도를 감소시켰다.
  • 제안된 갱신 법칙 하에서 증강된 시스템 상태와 크리틱 가중치 오차가 균일 최종 유계성(UUB)임을 증명하였다.
  • 재귀 행렬의 랭크 결함을 방지하기 위해, 지속적인 자극을 위해 딜레이징 노이즈를 사용하여 유지하였다.

실험 결과

연구 질문

  • RQ1가변 이득 경사 하강법을 적용한 크리틱 전용 IRL 프레임워크는 액추에이터 제약 조건이 있는 연속시간 비선형 시스템의 최적 추적 제어를 초기 안정화 제어기가 없이 달성할 수 있는가?
  • RQ2HJB 오차와 리아푸노프 도함수 기반의 가변 학습률은 일정 학습률 방법에 비해 수렴성 향상과 잔여 집합 크기 감소에 어떻게 기여하는가?
  • RQ3제안된 갱신 법칙 하에서 증강된 시스템의 안정성 행동은 어떠한가? 균일 최종 유계성이 보장될 수 있는가?
  • RQ4IRL 기반 이중 근사자 액터-크리틱 아키텍처에 비해 크리틱 전용 아키텍처는 계산 부담을 얼마나 감소시키는가?
  • RQ5부분적인 동역학 지식이 있는 실제 비선형 시스템, 예를 들어 6-DoF UAV와 같이, 제안된 방법은 얼마나 잘 성능을 발휘하는가?

주요 결과

  • 제안된 크리틱 전용 IRL 프레임워크와 가변 이득 경사 하강법은 증강된 시스템 상태와 크리틱 가중치 오차에 대해 균일 최종 유계성(UUB)을 달성한다.
  • 갱신 법칙 내에 포함된 안정화 항은 초기 안정화 제어기가 필요 없음을 성공적으로 제거하여, 기존의 IRL 및 ADP 기법에 비해 뚜렷한 이점이다.
  • HJB 오차와 리아푸노프 도함수 기반의 가변 학습률은 일정 학습률 방법에 비해 더 좁은 잔여 집합 크기를 제공한다.
  • 시뮬레이션 결과에 따르면, 크리틱 신경망 가중치가 유한 시간 내에 이상적인 가중치에 매우 가까운 값으로 수렴한다.
  • 엘레베이터, 에일러론, 루더의 제어 입력이 ±90도의 액추에이터 포화 한계 내에 유지되어 실시간 구현 가능성은 확인되었다.
  • 가치 함수 근사 오차는 근본적으로 0에 수렴하며, 이는 생성된 제어 정책이 근사적으로 최적이며 시뮬레이션에서 근본적으로 0에 가까운 비용을 기록함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.