Skip to main content
QUICK REVIEW

[논문 리뷰] A Finite Sample Complexity Bound for Distributionally Robust Q-learning

Shengbo Wang, Nian Si|arXiv (Cornell University)|2023. 02. 26.
Distributed Sensor Networks and Detection Algorithms인용 수 6
한 줄 요약

이 논문은 분포 이탈 하에서 강화 학습을 위한 모델 프리 분포로부스트 Q-학습 알고리즘을 제안하며, 유한한 표본 복잡도 보장을 제공한다. 다수준 몬테 카를로 추정기의 성능을 향상시켜 기대 표본 수가 일정하도록 함으로써, 초등 거리 노름에서 오차가 $\epsilon$ 이내인 로버스트 Q-함수 학습을 위한 최초의 유한한 기대 표본 복잡도 한계 $\tilde{O}(|S||A|(1-\gamma)^{-5}\epsilon^{-2}p_{\wedge}^{-6}\delta^{-4})$ 를 확립한다. 이는 재조정된 선형 또는 일정한 단계 크기에서 성립한다.

ABSTRACT

We consider a reinforcement learning setting in which the deployment environment is different from the training environment. Applying a robust Markov decision processes formulation, we extend the distributionally robust $Q$-learning framework studied in Liu et al. [2022]. Further, we improve the design and analysis of their multi-level Monte Carlo estimator. Assuming access to a simulator, we prove that the worst-case expected sample complexity of our algorithm to learn the optimal robust $Q$-function within an $ε$ error in the sup norm is upper bounded by $ ilde O(|S||A|(1-γ)^{-5}ε^{-2}p_{\wedge}^{-6}δ^{-4})$, where $γ$ is the discount rate, $p_{\wedge}$ is the non-zero minimal support probability of the transition kernels and $δ$ is the uncertainty size. This is the first sample complexity result for the model-free robust RL problem. Simulation studies further validate our theoretical results.

연구 동기 및 목표

  • 분포 이탈으로 인해 훈련 환경과 다른 환경에 배포된 표준 RL 정책의 취약성 해결.
  • 이전의 로버스트 Q-학습 방법이 기대 표본 수가 무한하기 때문에 유한한 표본 복잡도 보장이 부족한 한계를 극복.
  • 이론적 수렴 속도 보장이 있는 모델 프리, 표본 효율적인 분포로부스트 강화 학습 알고리즘 개발.
  • 분포로부스트 MDP 프레임워크 하에서 로버스트 Q-학습 문제에 대한 유한한 표본 복잡도 한계 설정.

제안 방법

  • Liu 등 (2022)의 다수준 몬테 카를로(MLMC) 추정기를 개선하여 추정기의 분산과 편향을 제어함으로써 기대 표본 수가 유한하도록 보장.
  • 모멘트 한계를 갖는 비편향 MLMC 기반 벨만 연산자 추정기를 도입하여 유한 표본 스토하스틱 근사 분석을 가능하게 함.
  • Chen 등 (2020)의 유한 표본 스토하스틱 근사 프레임워크를 적용하여 수렴성 분석 및 표본 복잡도 한계 유도.
  • 스토하스틱 근사 과정의 안정성과 수렴성을 확보하기 위해 재조정된 선형 또는 일정한 단계 크기 규칙 적용.
  • 전이 분포의 불확실성 집합 위에서 최악의 기대 수익을 최소화하는 로버스트 Q-학습 알고리즘 설계.
  • 향상된 추정기의 성질과 로버스트 MDP의 구조를 활용하여 기대 표본 복잡도에 대한 이론적 한계 증명.

실험 결과

연구 질문

  • RQ1모델 프리 분포로부스트 Q-학습 알고리즘을 유한한 기대 표본 복잡도로 설계할 수 있는가?
  • RQ2분포 이탈 하에서 최적의 로버스트 Q-함수를 학습하기 위한 최적의 표본 복잡도 한계는 무엇인가?
  • RQ3표본 복잡도는 할인 요소 $\gamma$, 최소 전이 확률 $p_{\wedge}$, 불확실성 크기 $\delta$와 같은 주요 문제 파라미터에 따라 어떻게 척도가 변하는가?
  • RQ4향상된 MLMC 추정기는 수렴성을 유지하면서도 기대 표본 사용 수가 유한한가?
  • RQ5표본 효율성과 수렴 속도 측면에서 이전 연구, 특히 Liu 등 (2022)과 비교해 본 알고리즘의 성능은 어떠한가?

주요 결과

  • 제안된 알고리즘은 초등 거리 노름에서 오차가 $\epsilon$ 이내인 최적의 로버스트 Q-함수 학습을 위한 유한한 기대 표본 복잡도 $\tilde{O}(|S||A|(1-\gamma)^{-5}\epsilon^{-2}p_{\wedge}^{-6}\delta^{-4})$ 를 달성한다.
  • 표본 복잡도 한계는 $|S||A|$ 에 대해 정확하고, 유효 수명 $(1-\gamma)^{-1}$ 에 대해 거의 정확하여 상태 및 행동 공간 크기에 대한 강력한 확장성 나타냄.
  • 기대 표본 사용 수가 유한함을 보장하기 위해 모멘트가 유한하고 비편향인 향상된 MLMC 추정기를 구성함으로써, Liu 등 (2022)의 핵심 한계를 해결.
  • 수치 실험을 통해 이론적 예측을 확인하였으며, 재조정된 선형 및 일정한 단계 크기 모두에서 로그-로그 스케일에서 수렴 속도가 $\tilde{O}(k^{-1/2})$ 와 일치함.
  • 작은 값과 큰 값에서 $\delta$ 의 변화에 대해 복잡도가 민감하지 않으며, 이는 $\delta \downarrow 0$ 일 때 $\delta$ 의 의존성이 $O(1)$ 임을 지지하는 것으로, 이전 기대와는 반대됨.
  • 분실 판매 재고 제어 실험에서, $g=5/8$ 인 본 알고리즘은 Liu 등 (2022)의 $g=0.499$ 보다 훨씬 적은 표본을 사용함으로써 뛰어난 표본 효율성 입증.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.