Skip to main content
QUICK REVIEW

[논문 리뷰] Logarithmic regret for episodic continuous-time linear-quadratic reinforcement learning over a finite-time horizon

Matteo Basei, Xin Guo|arXiv (Cornell University)|2020. 06. 27.
Advanced Bandit Algorithms Research참고 문헌 33인용 수 12
한 줄 요약

이 논문은 미지의 시스템 동역학을 가진 에피소드 기반 연속시간 선형-제곱형 제어 문제를 위한 최소 제곱 강화학습 알고리즘을 제안한다. 리카티 미분방정식의 펌핑 분석과 연속시간 추정기의 초지수적 성질을 활용하여, M개의 학습 에피소드 동안 $\mathcal{O}((\ln M)(\ln\ln M))$의 로그적 등가 손실을 달성하며, 시간 이산화 오차 기준을 유지하는 디지털 시간 구현으로의 확장도 가능하다.

ABSTRACT

We study finite-time horizon continuous-time linear-quadratic reinforcement learning problems in an episodic setting, where both the state and control coefficients are unknown to the controller. We first propose a least-squares algorithm based on continuous-time observations and controls, and establish a logarithmic regret bound of order $O((\ln M)(\ln\ln M))$, with $M$ being the number of learning episodes. The analysis consists of two parts: perturbation analysis, which exploits the regularity and robustness of the associated Riccati differential equation; and parameter estimation error, which relies on sub-exponential properties of continuous-time least-squares estimators. We further propose a practically implementable least-squares algorithm based on discrete-time observations and piecewise constant controls, which achieves similar logarithmic regret with an additional term depending explicitly on the time stepsizes used in the algorithm.

연구 동기 및 목표

  • 에피소드 기반 연속시간 선형-제곱형 강화학습에서 상태 및 제어 계수를 미리 알 수 없는 상황을 다루는 것.
  • 유한 시간 영역 설정에서 연속시간 LQR 문제에 대한 비점근적 손실 경계를 설정하는 것.
  • 시간 이산화 오차 기준을 유지하면서 이산시간 관측과 조각별로 일정한 제어 입력을 기반으로 실용적인 알고리즘을 개발하는 것.
  • 리카티 방정식의 안정성에 기반한 매개변수 추정 오차와 시스템 안정성 간의 상호작용을 분석하는 것.
  • 이론적 연속시간 RL과 구현 가능한 알고리즘 사이의 격차를 메우며, 이산화 효과를 정량화하는 것.

제안 방법

  • 모든 경로 관측을 활용한 연속시간 최소 제곱 추정기 설계를 통해 미지의 시스템 매개변수를 추정한다.
  • 매개변수 불확실성 하에서의 안정성과 강건성을 측정하기 위해 리카티 미분방정식의 펌핑 분석을 활용한다.
  • 연속시간 최소 제곱 추정기의 초지수 尾 꼬리 경계를 사용하여 매개변수 추정 오차를 제어한다.
  • 시간 간격 $\tau = T/N$을 사용한 조각별 일정한 제어와 시간 이산화를 활용한 이산시간 변형을 제안한다.
  • 신뢰 영역과 적응형 표본 수 $m_\ell = 2^\ell m_0$를 갖는 재귀적 학습 체계를 도입하여 에피소드 간에 매개변수 추정을 정밀화한다.
  • 시간 이산화 오차와 매개변수 불확실성에 기인한 제어 성능 손실을 고려하여 추정 오차 경계를 결합함으로써 손실 경계를 유도한다.

실험 결과

연구 질문

  • RQ1연속시간 최소 제곱 알고리즘이 미지의 동역학을 가진 에피소드 기반 LQR에서 로그적 손실을 달성할 수 있는가?
  • RQ2리카티 방정식의 정규성은 매개변수 불확실성 하에서 제어 정책의 강건성에 어떻게 영향을 미치는가?
  • RQ3이산시간 관측과 조각별 일정한 제어를 사용할 경우 시간 이산화가 손실에 어떤 영향을 미치는가?
  • RQ4이산 샘플링을 사용하는 실용적인 알고리즘이 연속시간 이상의 손실을 달성할 수 있는가?
  • RQ5매개변수 추정 오차가 충분히 빠르게 감소하여 로그적 손실을 도출할 수 있도록 보장하는 조건은 무엇인가?

주요 결과

  • 제안된 연속시간 최소 제곱 알고리즘은 M개의 학습 에피소드 동안 $\mathcal{O}((\ln M)(\ln\ln M))$의 손실 경계를 달성한다. 여기서 M은 학습 에피소드 수이다.
  • 손실 경계는 두 부분으로 나누어 분석되며, 리카티 방정식의 펌핑 분석과 최소 제곱 추정기의 초지수 꼬리 경계를 포함한다.
  • 이산시간 구현의 경우, 손실은 $\mathcal{O}((\ln M)(\ln\ln M))$에 더하여 시간 이산화 오차로 인한 추가 항 $\sum_{\ell=0}^{\ln M} m_\ell N_\ell^{-2}$로 제한된다.
  • 매개변수 추정 오차는 고확률적으로 $\mathcal{O}(\sqrt{(-\ln \delta)/m} + (-\ln \delta)/m + ((-\ln \delta)^2)/m^2 + 1/N)$로 감소함을 보였다. 여기서 m는 표본 수이고 N은 시간 이산화 단계 수이다.
  • 기대 피셔 정보 행렬 $\mathbb{E}[V^{\psi^{\theta,\tau}}]$의 역행렬성이 균일하게 유계이므로, 모든 에피소드 동안 안정적인 매개변수 추정이 보장된다.
  • 분석 결과, 컨트롤러가 시스템 동역학에 대한 사전 지식이 없더라도 미세한 정규성 및 식별 가능성 조건 하에서 알고리즘이 여전히 로그적 손실을 유지함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.