Skip to main content
QUICK REVIEW

[논문 리뷰] Corruption-robust exploration in episodic reinforcement learning

Thodoris Lykouris, Max Simchowitz|arXiv (Cornell University)|2019. 11. 20.
Advanced Bandit Algorithms Research참고 문헌 43인용 수 18
한 줄 요약

이 논문은 비정상적인 보상과 전이 동역학에 대한 적대적 오염에 강건한 탐색 프레임워크를 제안하며, 불확실성에 대한 낙관주의와 행동 제거 원리를 융합하여 i.i.d. 환경에서는 근사 최적의 누적 손실을 달성하고, 적대적 오염이 존재할 경우 보상과 전이 모두에서 점진적인 성능 저하를 보인다. 이는 비-i.i.d. 전이 동역학을 가진 밴딧 피드백 기반의 에피소딕 강화 학습에서 최초로 비선형 누적 손실 보장을 달성한다. 이는 표본형 및 선형 MDP 모두에 적용 가능하다.

ABSTRACT

We initiate the study of multi-stage episodic reinforcement learning under adversarial corruptions in both the rewards and the transition probabilities of the underlying system extending recent results for the special case of stochastic bandits. We provide a framework which modifies the aggressive exploration enjoyed by existing reinforcement learning approaches based on "optimism in the face of uncertainty", by complementing them with principles from "action elimination". Importantly, our framework circumvents the major challenges posed by naively applying action elimination in the RL setting, as formalized by a lower bound we demonstrate. Our framework yields efficient algorithms which (a) attain near-optimal regret in the absence of corruptions and (b) adapt to unknown levels corruption, enjoying regret guarantees which degrade gracefully in the total corruption encountered. To showcase the generality of our approach, we derive results for both tabular settings (where states and actions are finite) as well as linear-function-approximation settings (where the dynamics and rewards admit a linear underlying representation). Notably, our work provides the first sublinear regret guarantee which accommodates any deviation from purely i.i.d. transitions in the bandit-feedback model for episodic reinforcement learning.

연구 동기 및 목표

  • 에피소딕 학습 중 보상과 전이 동역학에 대한 적대적 오염에 취약한 기존 강화 학습 알고리즘의 문제를 해결하기 위해.
  • 다단계 강화 학습에서 적대적 오염 상황에서 기존 방법—불확실성에 대한 낙관주의와 단순한 행동 제거—의 한계를 극복하기 위해.
  • 오염이 발생하지 않을 경우 근사 최적의 누적 손실을 유지하면서도 오염 수준이 증가함에 따라 점진적으로 성능이 저하되는 계산적으로 효율적인 알고리즘을 개발하기 위해.
  • 밴딧 피드백 기반의 에피소딕 강화 학습에서 비-i.i.d. 전이 동역학 하에서 최초로 비선형 누적 손실 보장을 제공하기 위해.
  • 에피소딕 MDP 환경에서 표본형 및 선형 함수 근사 설정 모두에 강건성을 확장하기 위해.

제안 방법

  • 불확실성에 대한 낙관주의와 행동 제거 원리를 융합하여 적대적 오염에 강건한 하이브리드 프레임워크를 제안한다.
  • 다중 수준의 신뢰 구간과 행동 제거 임계값을 사용하는 계층적 탐색 전략을 설계하여 오염된 트래잭터리를 걸러낸다.
  • 자기 정규화된 마틴게일 집중 부등식을 활용해 오염된 피드백 하에서의 추정 오차를 제한하고, 고확률 보장을 확보한다.
  • 주요 정책을 통해 다수 수준 간의 탐색을 조율하고, 관측된 오염 수준에 따라 동적으로 조정한다.
  • Azuma-Hoeffding 및 Azuma-Bernstein 부등식을 사용해 보상과 전이 추정 오차의 마틴게일 차이를 제어한다.
  • 선형 함수 근사를 통해 MDP에서 가치 함수와 특징을 유한한 노름을 가진 방식으로 모델링하여 오염 상황에서도 확장 가능한 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1보상과 전이 모두에서 일부 에피소드가 오염된 상황에서도 효과적인 탐색 전략을 설계할 수 있는가?
  • RQ2불확실성에 대한 낙관주의 원칙과 행동 제거를 어떻게 통합하여 오염 상황에서 지수적 손실을 피할 수 있는가?
  • RQ3밴딧 피드백 기반의 에피소딕 강화 학습에서 탐색 효율성과 오염 강건성 사이의 기본적인 상충 관계는 무엇인가?
  • RQ4전이 동역학이 i.i.d.가 아닐 경우에도 적대적 오염 상황에서 에피소딕 강화 학습에서 비선형 누적 손실을 달성할 수 있는가? 이는 이전에 다루지 않은 설정이다.
  • RQ5모르는 오염 수준을 가진 선형 MDP에서 오염 강건 강화 학습의 가장 날카로운 가능한 누적 손실 상한은 무엇인가?

주요 결과

  • 선형 MDP에서 제안된 알고리즘은 오염된 에피소드 수 C에 대해 Õ(√(d³ + dA)K · CH⁴ · ln³(TAd/δ) + √(dK) · C²H⁵ · ln²(T/δ))의 누적 손실 상한을 달성한다.
  • C에 따라 성능이 점진적으로 저하되며, C = 0일 경우 근사 최적의 성능을 유지하고, T에 대해 비선형적으로 증가하는 것으로 스케일링된다.
  • 이 프레임워크는 비-i.i.i.d. 전이 동역학을 가진 밴딧 피드백 기반의 에피소딕 강화 학습에서 최초로 비선형 누적 손실 보장을 제공한다. 이는 이전 연구에 비해 중대한 발전이다.
  • 알고리즘은 계산적으로 효율적이며, C의 사전 지식이 필요 없으며, 적응적 신뢰 구간을 통해 알려지지 않은 오염 수준에 자동으로 적응한다.
  • 분석을 통해 단순한 행동 제거 전략은 H에 대해 지수적 손실을 초래함을 보여주며, 제안된 하이브리드 프레임워크의 필요성을 정당화한다.
  • 오염이 없을 경우 근사 최적의 누적 손실을 달성하면서도, 보상과 전이 모두에 대한 임의의 적대적 오염에 강건함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.