Skip to main content
QUICK REVIEW

[논문 리뷰] Policy Gradient Methods for the Noisy Linear Quadratic Regulator over a Finite Horizon

Ben Hambly, Renyuan Xu|arXiv (Cornell University)|2020. 11. 20.
Reinforcement Learning in Robotics참고 문헌 47인용 수 11
한 줄 요약

이 논문은 알려진 및 알려지지 않은 시스템 파라미터를 가진 유한한 시간 간격의 노이즈 있는 선형 제곱조절기(LQR) 문제를 해결하기 위한 정책 그래เดient 방법을 제안한다. 약한 가정 하에 전역 선형 수렴성을 확립하고, 모델 자유 학습 및 실제 응용 분야(예: 최적 자산 정리)에서 뛰어난 성능을 보이며, 모델 기반 기준보다 최대 20% 우수한 결과를 내는 것으로 실험적으로 입증되었다. 이는 모델 잘못 설정에 대해서도 더 강건한 성능을 발휘한다.

ABSTRACT

We explore reinforcement learning methods for finding the optimal policy in the linear quadratic regulator (LQR) problem. In particular, we consider the convergence of policy gradient methods in the setting of known and unknown parameters. We are able to produce a global linear convergence guarantee for this approach in the setting of finite time horizon and stochastic state dynamics under weak assumptions. The convergence of a projected policy gradient method is also established in order to handle problems with constraints. We illustrate the performance of the algorithm with two examples. The first example is the optimal liquidation of a holding in an asset. We show results for the case where we assume a model for the underlying dynamics and where we apply the method to the data directly. The empirical evidence suggests that the policy gradient method can learn the global optimal solution for a larger class of stochastic systems containing the LQR framework and that it is more robust with respect to model mis-specification when compared to a model-based approach. The second example is an LQR system in a higher dimensional setting with synthetic data.

연구 동기 및 목표

  • 스토케스틱 동역학을 가진 유한 시간 간격 LQR 문제에서 최적 제어를 위한 정책 그래데이언트 방법을 개발하고 분석한다.
  • 시스템 파라미터가 알려져 있지 않은 경우에도 약한 가정 하에 정책 그래데이언트 방법의 전역 선형 수렴 보장을 확립한다.
  • 실제 및 시뮬레이션된 LQR 환경에서 모델 자유 정책 그래데이언트 학습의 강건성과 성능을 평가한다.
  • 고차원 시스템 및 최적 자산 정리와 같은 실질적 응용 분야에서의 방법의 효과성을 입증한다.

제안 방법

  • 논문은 피드백 제어 정책 행렬의 매개변수 공간에서 정책 그래데이언트 하강법을 적용하여, 기대 비용 함수의 그래디언트를 사용해 정책을 갱신한다.
  • 시스템 동역학과 노이즈 구조에 대한 약한 가정 하에, 알려진 및 알려지지 않은 파라미터 모두에 대해 전역 선형 수렴을 증명한다.
  • 정책 공간의 제약 조건을 다루기 위해 투영된 정책 그래데이언트 방법을 도입하여 최적화 과정에서 타당한 갱신을 보장한다.
  • 알고리즘은 두 가지 시험 케이스에 적용된다: 실제 시장 데이터를 사용한 금융 자산의 최적 정리와 4차원 상태 및 2차원 제어를 가진 고차원 시뮬레이션 LQR 시스템.
  • 모두 알려지지 않은 파라미터의 경우, 샘플링된 궤적에서 시스템 행렬을 추정하고, 확률적 그래디언트 하강법을 사용해 정책을 갱신한다.
  • 수렴은 반복 횟수에 따른 정규화된 오차 감쇠를 통해 평가되며, 스텝 크기 선택에 대한 민감도 분석도 수행된다.

실험 결과

연구 질문

  • RQ1노이즈가 있는 스토케스틱 동역학을 가진 유한 시간 간격 LQR 문제에서, 약한 가정 하에 정책 그래데이언트 방법이 전역 선형 수렴을 달성할 수 있는가?
  • RQ2최적 자산 정리 작업에서, 모델 자유 정책 그래데이언트 학습의 성능은 Almgren-Chriss와 같은 모델 기반 접근법보다 어떻게 비교되는가?
  • RQ3정책 그래데이언트 방법은 파rametric 모델 기반 방법에 비해 모델 잘못 설정에 얼마나 강건한가?
  • RQ4합성 데이터를 사용한 고차원 LQR 문제에서 알고리즘의 스케일링 성능은 어떠한가?
  • RQ5모두 알려지지 않은 파라미터 설정에서 스텝 크기 선택이 수렴성과 안정성에 미치는 영향은 무엇인가?

주요 결과

  • 다양한 5개의 금융 주식에 대해, 모델 자유 정책 그래데이언트 방법은 샘플 내 및 샘플 외 모두에서 Almgren-Chriss 해법 대비 기대 비용에서 20% 향상된 성능을 보였다.
  • 고차원 시뮬레이션 LQR 케이스에서, 파라미터가 알려진 경우 스텝 크기가 0.0005일 때 80회 반복 이내에 정규화된 오차가 10⁻² 이하로 감소하였다.
  • 모두 알려지지 않은 파라미터의 경우, 수렴 속도가 느려지고 더 많은 반복이 필요하여 정책 최적화 과정에서 시스템 동역학을 학습하는 데 도전 과제가 있음을 시사했다.
  • 스텝 크기 선택은 수렴에 큰 영향을 미쳤다: 너무 작은 경우(예: 10⁻⁵)는 진전이 느렸고, 너무 큰 경우(예: 2×10⁻³)는 발산을 유도했다.
  • 모델 자유 정책 그래데이언트 접근법은 파라미터 기반 모델 기반 방법에 비해 더 강건한 성능을 보였으며, Almgren-Chriss 프레임워크는 강력한 파라미터 가정에 의존한다.
  • 실험 결과에 따르면, 정책 그래데이언트 방법은 엄격한 LQR 프레임워크를 초월한 다양한 스토케스틱 시스템의 전역 최적 해를 학습할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.