Skip to main content
QUICK REVIEW

[논문 리뷰] Exploration-exploitation trade-off for continuous-time episodic reinforcement learning with linear-convex models

Łukasz Szpruch, Tanut Treetanthiploet|arXiv (Cornell University)|2021. 12. 19.
Advanced Bandit Algorithms Research인용 수 4
한 줄 요약

이 논문은 미지의 선형 동역학을 가진 연속시간 순환 강화학습에 대한 확률적 프레임워크를 개발한다. 모델 매개변수의 추정치와 진짜 값 사이의 이차 성능 간격을 확립하여, 탐색과 이용을 적절히 균형 잡는 단계 기반 학습 알고리즘을 설계한다. 이 알고리즘은 $\mathcal{O}(\sqrt{N}\ln N)$의 고확률적 정규화와 $\mathcal{O}((\ln N)^2)$의 기대 정규화를 달성한다. 이는 상관된 연속시간 관측치에 특화된 새로운 농도 부등식을 활용한다.

ABSTRACT

We develop a probabilistic framework for analysing model-based reinforcement learning in the episodic setting. We then apply it to study finite-time horizon stochastic control problems with linear dynamics but unknown coefficients and convex, but possibly irregular, objective function. Using probabilistic representations, we study regularity of the associated cost functions and establish precise estimates for the performance gap between applying optimal feedback control derived from estimated and true model parameters. We identify conditions under which this performance gap is quadratic, improving the linear performance gap in recent work [X. Guo, A. Hu, and Y. Zhang, arXiv preprint, arXiv:2104.09311, (2021)], which matches the results obtained for stochastic linear-quadratic problems. Next, we propose a phase-based learning algorithm for which we show how to optimise exploration-exploitation trade-off and achieve sublinear regrets in high probability and expectation. When assumptions needed for the quadratic performance gap hold, the algorithm achieves an order $\mathcal{O}(\sqrt{N} \ln N)$ high probability regret, in the general case, and an order $\mathcal{O}((\ln N)^2)$ expected regret, in self-exploration case, over $N$ episodes, matching the best possible results from the literature. The analysis requires novel concentration inequalities for correlated continuous-time observations, which we derive.

연구 동기 및 목표

  • 미지의 선형 동역학을 가진 연속시간 순환 설정에서 모델 기반 강화학습을 위한 확률적 프레임워크를 개발한다.
  • 비용 함수의 정칙성 분석과 추정된 매개변수와 진짜 매개변수를 사용한 최적 제어 간의 성능 간격을 정량화한다.
  • 성능 간격이 이차적임을 보장하는 조건을 확립하여 이전의 선형 경계를 향상시킨다.
  • 탐색과 이용을 최적으로 균형 잡는 단계 기반 학습 알고리즘을 설계한다.
  • 문헌에서 최신 기준에 도달하는 결과를 얻을 수 있는 고확률 및 기대 정규화 경계를 유도한다.

제안 방법

  • 미지의 드리프트 매개변수를 가진 선형-볼록 스토케스틱 제어 문제에서 비용 함수의 정칙성을 연구하기 위해 확률적 표현을 사용한다.
  • 추정된 매개변수와 진짜 매개변수를 기반으로 한 피드백 제어 간의 성능 간격에 대해 정밀한 추정치를 도출하며, 적절한 조건 하에서 이차적 의존성을 보여준다.
  • 순차적인 베이지안 추론을 사용해 탐색 및 이용 단계를 번갈아 가며 수행하는 단계 기반 학습 알고리즘을 도입한다.
  • 상관된 연속시간 관측치에 특화된 새로운 농도 부등식을 활용해 추정 오차와 정규화를 분석한다.
  • 레비의 특성 정리를 적용해 필터링된 과정이 브라운 운동임을 보여주며, 상태 과정의 반마르팅게일 표현을 가능하게 한다.
  • 진행 가능성과 마르팅게일 성질을 통해 추정된 매개변수 $\hat{\bm{\theta}}^{\bm{\Psi},m}$ 의 ${\mathcal{G}}^{\bm{\Psi}}_m$-가측성을 확립한다.

실험 결과

연구 질문

  • RQ1추정된 매개변수와 진짜 매개변수를 사용한 최적 제어 간 성능 간격이 선형이 아닌 이차적으로 스케일링되는 조건은 무엇인가?
  • RQ2미지의 선형 동역학을 가진 연속시간 순환 강화학습에서 탐색과 이용을 어떻게 최적으로 균형 잡을 수 있는가?
  • RQ3상관된 연속시간 관측치가 존재할 경우 단계 기반 학습 알고리즘을 통해 달성할 수 있는 정규화 경계는 무엇인가?
  • RQ4의존적인 연속시간 과정에 대해 새로운 농도 부등식을 유도하고 강화학습에 적용할 수 있는가?
  • RQ5선형-볼록 제어 문제에서 모델 불확실성, 비용 함수의 정칙성, 학습 성능 간의 상호작용은 어떠한가?

주요 결과

  • 적절한 정칙성 조건 하에서 추정된 매개변수와 진짜 매개변수를 사용한 최적 피드백 제어 간 성능 간격이 이차적임을 보여주며, 이는 이전 연구에서의 선형 간격을 향상시킨다.
  • 성능 간격이 이차적임 조건이 만족될 경우, 제안된 단계 기반 알고리즘이 $N$ 에피소드 동안 $\mathcal{O}(\sqrt{N}\ln N)$의 고확률적 정규화를 달성한다.
  • 자기 탐색 케이스에서는 알고리즘이 $\mathcal{O}((\ln N)^2)$의 기대 정규화를 달성하며, 문헌에서 알려진 최고의 결과와 일치한다.
  • 분석 과정에서 상관된 연속시간 관측치에 특화된 새로운 농도 부등식을 도입하였으며, 이는 순차적 학습에서 추정 오차를 유한하게 제한하는 데 필수적이다.
  • 관측 필터링에 대한 상태 과정의 반마르팅게일 표현은 추정된 매개변수에 대한 엄밀한 가측성 및 추론 결과를 가능하게 한다.
  • 이 프레임워크는 일반적인 볼록 비용 함수, 특히 비연속 및 제약 조건이 있는 제어를 포함한 비선형-이차 모델을 초월해 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.