Skip to main content
QUICK REVIEW

[논문 리뷰] Online Robust Reinforcement Learning with Model Uncertainty

Yue Wang, Shaofeng Zou|arXiv (Cornell University)|2021. 09. 29.
Reinforcement Learning in Robotics참고 문헌 67인용 수 6
한 줄 요약

이 논문은 잘못된 모델을 가진 MDP의 단일 트레이잭터리에서 유추된 불확실성 집합을 이용해 모델 불확실성을 다루는 온라인 강화학습 알고리즘을 제안한다. 표본 크기가 작은 설정에서는 강화된 Q-학습을, 함수 근사에서는 강화된 TDC를 제안하며, 할인 인자에 대한 제약 조건 없이 渐近 수렴하며, 일반적인 알고리즘의 수렴 속도와 비슷한 상수 배수 내에서 수렴한다. 또한 분포 이탈에 대한 강건성을 유지한다.

ABSTRACT

Robust reinforcement learning (RL) is to find a policy that optimizes the worst-case performance over an uncertainty set of MDPs. In this paper, we focus on model-free robust RL, where the uncertainty set is defined to be centering at a misspecified MDP that generates a single sample trajectory sequentially and is assumed to be unknown. We develop a sample-based approach to estimate the unknown uncertainty set and design a robust Q-learning algorithm (tabular case) and robust TDC algorithm (function approximation setting), which can be implemented in an online and incremental fashion. For the robust Q-learning algorithm, we prove that it converges to the optimal robust Q function, and for the robust TDC algorithm, we prove that it converges asymptotically to some stationary points. Unlike the results in [Roy et al., 2017], our algorithms do not need any additional conditions on the discount factor to guarantee the convergence. We further characterize the finite-time error bounds of the two algorithms and show that both the robust Q-learning and robust TDC algorithms converge as fast as their vanilla counterparts(within a constant factor). Our numerical experiments further demonstrate the robustness of our algorithms. Our approach can be readily extended to robustify many other algorithms, e.g., TD, SARSA, and other GTD algorithms.

연구 동기 및 목표

  • 강화학습에서 모델 불일치로 인한 정책 성능 저하 문제를 해결한다.
  • 오차가 있는 MDP의 단일 트레이잭터리에서 실시간으로 불확실성 집합을 추정하는 모델 프리 모델 기반 강건 RL 프레임워크를 개발한다.
  • 사전에 불확실성 집합을 알 필요 없이, 대규모 또는 고차원 환경에서의 확장 가능한 구현을 가능하게 한다.
  • 이전 연구와 달리 할인 인자에 대한 제약 조건 없이 강건 학습 알고리즘의 수렴을 보장한다.
  • 비강건 대비 상수 요인 내에서 유한 시간 오차 경계를 확보한다.

제안 방법

  • 오차가 있는 MDP를 중심으로 불확실성 집합을 정의하기 위해 R-오염 모델을 사용하여, 악성 전이 커널 변화에 대한 강건성을 확보한다.
  • 기존 데이터만을 이용해 불확실성 집합을 점진적으로 추정하는 온라인 샘플 기반 추정 방법을 설계하여, 추가 메모리 오버헤드를 방지한다.
  • 표본 크기 MDP에 적합한 강건 Q-학습 알고리즘을 제안하며, 부드럽게 조정된 강건 벨먼 연산자를 사용해 Q-값을 갱신함으로써 최적의 강건 Q-함수로 수렴함을 보장한다.
  • 함수 근사로의 확장을 위해 이중 시간 척도 강건 TDC 알고리즘을 제안하며, 안정적인 학습을 위해 부드러운 평균 제곱 프로젝션 강건 벨먼 오차(MSPRBE)를 사용한다.
  • 진짜 MDP가 데이터 수집에 사용된 MDP와 다를 수 있는 '오프 전이 커널' 설정을 다룰 수 있도록 새로운 부드러운 강건 벨먼 연산자를 도입한다.
  • 두 알고리즘 모두 점점 수렴성과 유한 시간 오차 경계를 증명하며, 일반 Q-학습 및 TDC와 비슷한 상수 배수 내에서 수렴 속도를 확보한다.

실험 결과

연구 질문

  • RQ1불확실성 집합이 알려져 있지 않고 단일 트레이잭터리에서 추정되어야 할 경우, 모델 프리 온라인 강건 RL이 가능할 수 있는가?
  • RQ2기존 방법과 달리, 이전 연구에서 요구하는 할인 인자에 대한 제약 조건 없이 제안된 강건 Q-학습 알고리즘이 수렴하는가?
  • RQ3유한 시간 오차 경계 측면에서 강건 Q-학습 및 강건 TDC 알고리즘의 수렴 속도는 비강건 대비 얼마나 유사한가?
  • RQ4표준 TD 방법이 발산할 수 있는 상황에서도 강건 TDC 알고리즘이 함수 근사 하에서 안정성과 수렴성을 유지할 수 있는가?
  • RQ5실험적 평가를 통해 제안된 방법이 모델 불일치가 있는 환경에서 얼마나 강건성을 향상시키는가?

주요 결과

  • 강건 Q-학습 알고리즘은 할인 인자에 대한 조건 없이 최적의 강건 Q-함수로 점점 수렴하며, Roy 등(2017)과 달리 이에 대한 제약이 없다.
  • 강건 Q-학습의 유한 시간 오차 경계는 일반 Q-학습과 비슷한 상수 배수 내에서 스케일링되며, 이는 유사한 수렴 속도를 의미한다.
  • 강건 TDC 알고리즘은 점점 수렴하여 정적 점에 도달하며, 함수 근사 하에서도 안정성을 유지한다. 반면 일반 TDC는 같은 설정에서 발산할 수 있다.
  • 수치 실험 결과, 강건 Q-학습은 특히 학습용 MDP와 테스트용 MDP 간 불일치가 클수록 일반 Q-학습보다 훨씬 높은 보상을 달성한다.
  • 강건 TDC 알고리즘은 일반 TDC보다 빠르게 수렴하며 안정성을 유지하지만, 일반 TDC는 같은 설정에서 발산함을 보여주며, 함수 근사에서 강건성의 필요성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.