Skip to main content
QUICK REVIEW

[논문 리뷰] Sample Complexity of Robust Reinforcement Learning with a Generative Model

Kishan Panaganti, Dileep Kalathil|arXiv (Cornell University)|2021. 12. 02.
Reinforcement Learning in Robotics참고 문헌 29인용 수 7
한 줄 요약

이 논문은 명시된 모델이 알려져 있지 않지만 생성 모델이 가용할 때, $\varepsilon$-최적의 강건 정책을 학습하기 위한 모델 기반 강화 학습 알고리즘인 강건 경험적 가치 반복(Revised Empirical Value Iteration, REVI)을 제안한다. 총 변동, 카이제곱, KL 발산 세 가지 불확실성 집합에 대해 유한 샘플 보장을 수립하여 정확한 샘플 복잡도 경계를 제공하고, 시뮬레이션에서 실제 환경으로의 전이 시나리오에서 강건 정책이 비강건 정책보다 이론적으로 유리함을 보여준다.

ABSTRACT

The Robust Markov Decision Process (RMDP) framework focuses on designing control policies that are robust against the parameter uncertainties due to the mismatches between the simulator model and real-world settings. An RMDP problem is typically formulated as a max-min problem, where the objective is to find the policy that maximizes the value function for the worst possible model that lies in an uncertainty set around a nominal model. The standard robust dynamic programming approach requires the knowledge of the nominal model for computing the optimal robust policy. In this work, we propose a model-based reinforcement learning (RL) algorithm for learning an $ε$-optimal robust policy when the nominal model is unknown. We consider three different forms of uncertainty sets, characterized by the total variation distance, chi-square divergence, and KL divergence. For each of these uncertainty sets, we give a precise characterization of the sample complexity of our proposed algorithm. In addition to the sample complexity results, we also present a formal analytical argument on the benefit of using robust policies. Finally, we demonstrate the performance of our algorithm on two benchmark problems.

연구 동기 및 목표

  • 명시된 시뮬레이터 모델이 알려져 있지 않지만 생성 모델이 가용한 상황에서 강건 정책을 학습하는 데 도전 과제를 해결한다.
  • 총 변동, 카이제양, KL 발산으로 정의된 불확실성 집합 하에서 비점근적이고 유한 샘플 성능 보장을(샘플 복잡도) 제공한다.
  • 모델 불일치로 인한 시뮬레이션에서 실제 환경으로의 전이가 발생할 때 강건 정책이 비강건 정책보다 우월함을 공식적으로 입증한다.
  • 비강건 RL 설정과 비교하여 제안된 알고리즘의 샘플 복잡도를 특성화하여 강건성이 자료 효율성에 어떻게 영향을 미치는지 분석한다.

제안 방법

  • 생성 모델에서의 샘플을 이용해 $\varepsilon$-최적의 강건 정책을 학습하는 모델 기반 강화 학습 방법인 강건 경험적 가치 반복(REVI) 알고리즘을 제안한다.
  • 비선형성과 강건 동적 프rogramming에서의 편향을 다루기 위해 커버링 수 개념을 활용한 균일 농도 경계를 적용하여 유한 샘플 분석을 가능하게 한다.
  • 각 불확실성 집합(TV, 카이제곱, KL)에 대해, 경험적 추정치와 진정한 강건 가치 간의 편차를 분석하여 농도 부등식을 활용해 샘플 복잡도 경계를 유도한다.
  • 강건 MDP 이론의 이중성 결과를 활용해 최적의 강건 가치 함수를 계산하고, 이를 비강건 정책과 비교한다.
  • 경험적 강건 가치 추정치의 편향을 제한하기 위한 새로운 분석 기법을 도입하여, 일반적으로 비편향 설정에서만 유효한 농도 부등식을 적용할 수 있도록 한다.
  • 두 모델($P^o$ 및 $P'$)을 가진 결정론적 MDP 예제를 사용하여, 모델 불일치 상황에서 비강건 정책와 강건 정책 간의 성능 격차를 해석적으로 분석한다.

실험 결과

연구 질문

  • RQ1명시된 모델이 알려져 있지 않지만 생성 모델이 가용할 때, $\varepsilon$-최적의 강건 정책을 학습하는 데 필요한 샘플 복잡도는 얼마인가?
  • RQ2총 변동, 카이제곱, KL 발산으로 정의된 다양한 불확실성 집합에서 강건 RL의 샘플 복잡도는 어떻게 변화하는가?
  • RQ3시뮬레이터 모델이 실제 세계 시스템과 다를 때, 강건 정책이 비강건 정책보다 이론적으로 어떤 이점을 갖는가?
  • RQ4모델 기반 설정에서 생성 모델이 제공될 때 강건 RL 알고리즘에 대해 유한 샘플 보장을 수립할 수 있는가?
  • RQ5동일한 성능 및 신뢰 수준 요구 조건 하에서 강건 RL의 샘플 복잡도는 비강건 RL에 비해 어떻게 비교되는가?

주요 결과

  • 총 변동 불확실성 집합에 대해 REVI의 샘플 복잡도는 $\mathcal{O}\left(\frac{|\mathcal{S}|^{2}|\mathcal{A}|}{(1-\gamma)^{4}\varepsilon^{2}}\right)$이며, 상수 항을 제외하고 비강건 RL의 복잡도와 일치한다.
  • 카이제곱 불확실성 집합의 경우 샘플 복잡도는 $\mathcal{O}\left(\frac{c_{r}|\mathcal{S}|^{2}|\mathcal{A}|}{(1-\gamma)^{4}\varepsilon^{2}}\right)$이며, 여기서 $c_r$은 강건성 매개변수이다.
  • KL 불확실성 집합의 경우 샘플 복잡도는 $\mathcal{O}\left(\frac{|\mathcal{S}|^{2}|\mathcal{A}|\exp(1/(1-\gamma))}{c_{r}^{2}(1-\gamma)^{4}\varepsilon^{2}}\right)$이며, 할인 인자 역수에 대해 지수적 의존성을 보여준다.
  • 논문은 강건 정책가 실제 세계 모델이 시뮬레이터와 다를 경우 비강건 정책보다 훨씬 우수한 최악의 성능을 달성할 수 있음을 공식적으로 증명하며, 성능 격차의 하한은 $\frac{\gamma}{198(1-\gamma)}$이다.
  • 제안된 알고리즘은 $\varepsilon$-최적성 확률 $1-\delta$로 유한 수의 샘플을 사용하여 달성하며, $k$와 $N$의 경계는 $\varepsilon$, $\gamma$, $c_r$, $\delta$에 따라 달라진다.
  • 분석 결과, 균일 농도 및 커버링 수 개념을 활용함으로써 경험적 추정치가 편향이 있을 경우에도 강건 RL이 증명 가능한 유한 샘플 보장을 갖는 것이 가능하다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.