Skip to main content
QUICK REVIEW

[논문 리뷰] Learning robust control for LQR systems with multiplicative noise via policy gradient.

|arXiv (Cornell University)|2019. 05. 28.
Adaptive Dynamic Programming Control참고 문헌 58인용 수 11
한 줄 요약

이 논문은 다중성 소음이 있는 선형 제곱조절기(LQR) 시스템에서 강건한 제어를 학습하기 위한 정책 그래디언트 방법을 제안하며, 특수한 그래디언트 지배 성질을 활용하여 최적 정책으로의 전역 수렴을 보장한다. 이 방법은 모델가지기 및 모델모르기 설정 모두에서 궤적 샘플을 사용하여 작동하며, 증명 가능한 강건성 향상과 함께 다항 시간 수렴을 달성한다.

ABSTRACT

The linear quadratic regulator (LQR) problem has reemerged as an important theoretical benchmark for reinforcement learning-based control of complex dynamical systems with continuous state and action spaces. In contrast with nearly all recent work in this area, we consider multiplicative noise models, which are increasingly relevant because they explicitly incorporate inherent uncertainty and variation in the system dynamics and thereby improve robustness properties of the controller. Robustness is a critical and poorly understood issue in reinforcement learning; existing methods which do not account for uncertainty can converge to fragile policies or fail to converge at all. Additionally, intentional injection of multiplicative noise into learning algorithms can enhance robustness of policies, as observed in ad hoc work on domain randomization. Although policy gradient algorithms require optimization of a non-convex cost function, we show that the multiplicative noise LQR cost has a special property called gradient domination, which is exploited to prove global convergence of policy gradient algorithms to the globally optimum control policy with polynomial dependence on problem parameters. Results are provided both in the model-known and model-unknown settings where samples of system trajectories are used to estimate policy gradients.

연구 동기 및 목표

  • 지속적 제어 시스템의 강건성 문제를 해결하기 위한 핵심 과제에 대응함: 특히 내재된 시스템 불확실성이 존재하는 상황에서의 강건성.
  • LQR 시스템에서 다중성 소음을 수학적으로 형식화하고 분석하여 제어기의 강건성을 향상시키는 수단으로서의 기능을 규명함.
  • 비볼록 비용 함수가 존재하더라도 전역 최적 제어 정책으로 수렴하는 것을 보장하는 정책 그래디언트 알고리즘을 개발함.
  • 모델가지기 및 모델모르기 설정 모두에서 시스템 궤적 샘플을 사용하여 수렴 보장을 수립함.
  • 의 intensional 다중성 소음 주입이 정책의 강건성을 향상시키며, 도메인 랜덤라이제이션과 같은 경험적 기법과 일치함을 입증함.

제안 방법

  • 다중성 소음을 고려한 LQR 문제를 수식화하여, 상태 또는 제어 입력에 따라 스케일링되는 과정 소음을 갖는 시스템 동역학을 모델링함.
  • 다중성 소음 LQR 비용 함수의 그래디언트 지배 성질을 활용함. 이 성질은 기울기가 작은 점이 항상 전역 최적점에 가까운 점임을 보장함.
  • 샘플된 시스템 궤적에서 유도된 기울기를 사용하여 정책 그래디언트 알고리즘을 적용하여 제어 정책을 최적화함.
  • 비용 함수의 비볼록성에도 불구하고 문제 매개변수에 다항적 의존성을 가지며 전역 최적 정책으로 수렴하는 것을 증명함.
  • 모델가지기 설정에서는 진짜 기울기를 사용하고, 모델모르기 설정에서는 관측된 궤적에서 유도된 경험적 추정치를 사용함.
  • 표준 정책 그래디언트 방법을 일반화하여, 강건성을 향상시키고 이론적 수렴 보장을 가능하게 하는 소음 구조를 통합함.

실험 결과

연구 질문

  • RQ1비볼록 비용 함수가 존재하더라도 다중성 소음이 있는 LQR 시스템에서 정책 그래디언트 방법이 전역 수렴을 달성할 수 있는가?
  • RQ2다중성 소음의 존재가 학습된 제어 정책의 강건성을 어떻게 향상시키는가?
  • RQ3이 설정에서 정책 그래디언트 알고리즘이 전역 최적 정책으로 수렴하기 위한 이론적 조건은 무엇인가?
  • RQ4모델가지기 및 모델모르기 상황에서 수렴 속도는 시스템 매개변수에 따라 어떻게 척도가 조정되는가?
  • RQ5이 프레임워크는 강화학습에서 도메인 랜덤라이제이션의 경험적 성공을 설명하거나 수학적으로 형식화할 수 있는가?

주요 결과

  • 다중성 소음 LQR 비용 함수는 그래디언트 지배 성질을 가지며, 이는 정책 그래디언트 방법의 전역 수렴 보장을 가능하게 한다.
  • 정책 그래디언트 알고리즘이 모델가지기 및 모델모르기 설정 모두에서 문제 매개변수에 다항적 의존성을 가지며 전역 최적 제어 정책으로 수렴함.
  • 모델링된 다중성 소음을 통해 시스템 불확실성을 명시적으로 표현함으로써 강건성을 확보하고 제어기의 내구성을 향상시킴.
  • 이론적 분석을 통해 표준 방법이 실패할 수 있는 경우에도 취약한 정책을 피하고 수렴을 보장함을 확인함.
  • 경험적 결과는 다중성 소음 주입이 정책의 강건성을 향상시키며, 도메인 랜덤라이제이션 관행과 일치함을 지지함.
  • 이 프레임워크는 연속 상태 및 행동 공간 시스템에서 강화학습을 이용한 강건 제어를 위한 체계적인 기반을 제공함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.