Skip to main content
QUICK REVIEW

[논문 리뷰] A Model Selection Approach for Corruption Robust Reinforcement Learning

Chen-Yu Wei, Christoph Dann|arXiv (Cornell University)|2021. 10. 07.
Advanced Bandit Algorithms Research참고 문헌 68인용 수 4
한 줄 요약

이 논문은 전이와 보상 둘 다 악성 교란이 존재하는 강화학습 환경에서, 교란 수준에 대한 사전 지식 없이도 최적의 리그레트 한계를 달성하는 모델 선택 프레임워크를 제안한다. 서로 다른 교란 수준에 맞추어 캘리브레이션된 기본 알고리즘들 간의 리그레트 균형을 활용하여, 표본형 MDP에서는 $\widetilde{\mathcal{O}}(\min\{1/\Delta, \sqrt{T}\} + C)$, 선형 MDP에서는 $\widetilde{\mathcal{O}}(\sqrt{(1+C)T})$의 최악의 경우 최적 리그레트를 달성하며, 교란에 강건한 강화학습 분야의 열린 문제를 해결한다.

ABSTRACT

We develop a model selection approach to tackle reinforcement learning with adversarial corruption in both transition and reward. For finite-horizon tabular MDPs, without prior knowledge on the total amount of corruption, our algorithm achieves a regret bound of $\widetilde{\mathcal{O}}(\min\{\frac{1}Δ, \sqrt{T}\}+C)$ where $T$ is the number of episodes, $C$ is the total amount of corruption, and $Δ$ is the reward gap between the best and the second-best policy. This is the first worst-case optimal bound achieved without knowledge of $C$, improving previous results of Lykouris et al. (2021); Chen et al. (2021); Wu et al. (2021). For finite-horizon linear MDPs, we develop a computationally efficient algorithm with a regret bound of $\widetilde{\mathcal{O}}(\sqrt{(1+C)T})$, and another computationally inefficient one with $\widetilde{\mathcal{O}}(\sqrt{T}+C)$, improving the result of Lykouris et al. (2021) and answering an open question by Zhang et al. (2021b). Finally, our model selection framework can be easily applied to other settings including linear bandits, linear contextual bandits, and MDPs with general function approximation, leading to several improved or new results.

연구 동기 및 목표

  • 전이와 보상 둘 다 악성으로 교란될 때, 총 교란량 C에 대한 사전 지식 없이도 최적 리그레트를 달성하는 문제를 해결하기 위해.
  • 다양한 가정된 교란 수준에 맞게 설계된 기본 알고리즘들 사이에서 적응적으로 선택하는 모델 선택 프레임워크를 개발하기 위해.
  • T(에피소드 수)와 C(교란 수준)에 대해 최적의 스케일링을 보장하는 최악의 경우 최적 리그레트 한계를 달성하기 위해.
  • 선형 MDP 및 선형 밴딧, 컨텍스트 밴딧과 같은 다른 환경으로 프레임워크를 확장하여, 개선되거나 새로운 이론적 보장을 도출하기 위해.

제안 방법

  • 각각 다른 추정된 교란 수준에 맞게 캘리브레이션된 기본 알고리즘의 여러 인스턴스를 유지하는 메타알고리즘, COBE(Corruption-robustness through Balancing and Elimination)를 사용한다.
  • 중요도 가중치 $\alpha_i$를 정밀하게 선택하여 리그레트 균형을 적용함으로써, 각 기본 알고리즘의 성능가 비슷하게 유지되도록 하여, 어떤 하나의 알고리즘도 과도하게 손상되지 않도록 한다.
  • 기본 알고리즘 인스턴스의 조기 종료가 발생할 때마다, 현재 추정치가 너무 낮았음을 시사하므로, 추정 교란 수준 $k$를 동적으로 증가시킨다.
  • 누적 리그레트와 신뢰 구간에 기반한 정지 조건을 사용하는 계층적 교란 가설에 대한 모델 선택을 수행하는 서브루틴인 BASIC을 프레임워크는 기반으로 한다.
  • 기본 알고리즘의 성능를 다양한 교란 가정 하에 모델링하기 위해, $\mathcal{R}(t,\theta) = \sqrt{\beta_1 t} + \beta_2 \theta + \beta_3$ 형태의 매개변수화된 리그레트 한계를 사용한다.
  • 진짜 교란 수준이 알려져 있지 않더라도, 전체 리그레트가 후행적으로 가장 좋은 기본 알고리즘의 리그레트에 비해 다항로그 인자 내에서 유지됨을 보장한다.

실험 결과

연구 질문

  • RQ1총 교란량 C가 알려져 있지 않을 때, 표본형 MDP에서 T와 C에 대해 최적의 리그레트 한계를 달성할 수 있는가?
  • RQ2사전 지식 없이도, 정확한 교란 수준을 적응적으로 식별하면서 근사 최적 리그레트를 유지할 수 있는 모델 선택 프레임워크를 설계할 수 있는가?
  • RQ3제안된 방법을 선형 MDP로 확장하여 $\widetilde{\mathcal{O}}(\sqrt{(1+C)T})$ 형태의 최적 리그레트 한계를 달성할 수 있는가?
  • RQ4선형 밴딧 및 컨텍스트 밴딧과 같은 유사 환경에서 모델 선택 프레임워크가 개선되거나 새로운 결과를 도출할 수 있는가?
  • RQ5C에 대한 사전 지식 없이도, $\widetilde{\mathcal{O}}(\min\{1/\Delta, \sqrt{T}\} + C)$ 형태의 인스턴스 의존 리그레트 한계를 달성할 수 있는가?

주요 결과

  • 유한 수평 표본형 MDP에서 제안된 알고리즘은 $\widetilde{\mathcal{O}}(\min\{1/\Delta, \sqrt{T}\} + C)$의 리그레트 한계를 달성하며, 이는 C에 대한 사전 지식 없이도 최초의 최악의 경우 최적 리그레트 한계이다.
  • 이 한계는 Wu 등(2021)이 확립한 정보 이론적 하한과 정확히 일치하여, 교란에 강건한 강화학습 분야에서 오랫동안 남아 있던 열린 문제를 해결한다.
  • 유한 수평 선형 MDP에서, 계산적으로 효율적인 변형을 사용하여 $\widetilde{\mathcal{O}}(\sqrt{(1+C)T})$의 리그레트 한계를 달성하며, 이는 이전 작업보다 향상된 결과이다.
  • Zhang 등(2021)이 제기한 선형 MDP에서 C에 대한 최적 의존성 문제에 대한 답을 제시한다.
  • 이 방법은 선형 밴딧, 선형 컨텍스트 밴딧, 일반 함수 근사가 가능한 MDP로 일반화되며, 이러한 환경에서 개선되거나 새로운 리그레트 한계를 도출한다.
  • 모델 선택 접근법은 진짜 교란 수준이 알려져 있지 않더라도, 리그레트가 후행적으로 가장 좋은 기본 알고리즘의 리그레트에 비해 다항로그 인자 내에서 유지됨을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.