[논문 리뷰] Improved Corruption Robust Algorithms for Episodic Reinforcement Learning
이 논문은 에피소드 기반 강화 학습에서 손상에 강건한 새로운 알고리즘을 제안하며, 단지 손상된 에피소드 수가 아니라 보다 정교한 손상 정도(보상 및 전이 손상)에 의존함으로써 엄격히 향상된 리그레트 한계를 달성한다. 보상-free 탐색 서브루틴과 두 가지 메타알고리즘을 도입하여 손상 수준에 대해加법적 의존성을 확보함으로써, 이는 표본형 강화 학습에서 증명 가능한 최적성과 함께 처음으로 이뤄지는 결과이다.
We study episodic reinforcement learning under unknown adversarial corruptions in both the rewards and the transition probabilities of the underlying system. We propose new algorithms which, compared to the existing results in (Lykouris et al., 2020), achieve strictly better regret bounds in terms of total corruptions for the tabular setting. To be specific, firstly, our regret bounds depend on more precise numerical values of total rewards corruptions and transition corruptions, instead of only on the total number of corrupted episodes. Secondly, our regret bounds are the first of their kind in the reinforcement learning setting to have the number of corruptions show up additively with respect to $\min\{\sqrt{T}, ext{PolicyGapComplexity}\}$ rather than multiplicatively. Our results follow from a general algorithmic framework that combines corruption-robust policy elimination meta-algorithms, and plug-in reward-free exploration sub-algorithms. Replacing the meta-algorithm or sub-algorithm may extend the framework to address other corrupted settings with potentially more structure.
연구 동기 및 목표
- 에피소드 기반 강화 학습에서 적대적 손상에 대한 기존 연구의 한계를 해결하기 위해.
- 단지 손상된 에피소드 수가 아니라 보상 및 전이 손상의 정확한 정도에 의존하는 알고리즘을 개발하기 위해.
- 손상 수준에 대해 곱셈적 의존성이 아닌 가감적 의존성을 갖는 리그레트 한계를 달성하여, 분야 내 열린 문제를 해결하기 위해.
- 더 넓은 적용 가능성을 위해 손상에 강건한 정책 제거와 보상-무료 탐색의 일반 프레임워크를 제공하기 위해.
제안 방법
- C^p + C^r이 작은 경우에만 ε + (C^p + C^r)ε² 수준의 정확도를 갖는 정책 가치 추정치를 반환하는 손상에 강건한 보상-무료 탐색 알고리즘 EstAll을 제안한다.
- EstAll을 사용하는 메타알고리즘 BARBAR-RL을 도입하여, 비적응형 적대자에 대해 Õ(min{√T, PolicyGapComplexity} + (1 + C^p)(C^p + C^r))의 리그레트를 달성한다.
- 적응형 적대자(정책을 관찰한 후 손상) 상황에서 Õ(√T + (C^p + C^r)²)의 리그레트를 달성하는 BrutePolicyElimination-RL 메타알고리즘을 개발한다.
- 손상에 강건한 메타알고리즘과 플러그인 보상-무료 탐색 서브루틴을 결합한 일반 프레임워크를 활용하여 더 높은 강건성을 확보한다.
- 보상-무료 탐색 단계에서 상태-행동 방문 빈도와 Q-값 추정 오차를 핵심 추정기로 사용한다.
- 전이 커널과 보상 함수 간의 총 변동 거리에 기반한 가치 함수 차이에 대한 이론적 한계를 적용한다.
실험 결과
연구 질문
- RQ1에피소드 기반 강화 학습에서 리그레트 한계를 곱셈적 의존성 대신 가감적 의존성으로 손상 정도에 따라 만들 수 있는가?
- RQ2손상된 에피소드 수를 알 수 없을 때조차, 표본형 강화 학습에서 총 손상 C^p와 C^r에 대해 가감적 의존성을 달성할 수 있는가?
- RQ3보상-무료 탐색을 적대적 손상(보상 및 전이 모두)에 강건하게 만들 수 있는가?
- RQ4정책 제거 방식 알고리즘이 손상 존재 하에서 인스턴스에 따라 달라지는 리그레트 한계를 달성할 수 있는가?
- RQ5추가적인 구조적 가정이 있을 경우, 이 프레임워크를 다른 손상된 강화 학습 설정으로 확장할 수 있는가?
주요 결과
- 제안된 BARBAR-RL 메타알고리즘은 비적응형 적대자 하에서 Õ(min{√T, PolicyGapComplexity} + (1 + C^p)(C^p + C^r))의 리그레트를 달성하며, 손상 정도에 대해 가감적 의존성을 확보한다.
- BrutePolicyElimination-RL 메타알고리즘은 적응형 적대자 하에서 Õ(√T + (C^p + C^r)²)의 리그레트를 달성하여, 표본형 강화 학습에서 손상 수준에 대해 처음으로 가감적 의존성을 확보한다.
- EstAll은 C^p ≤ Õ(1/ε일 경우, 샘플 복잡도 Õ(log|Π|/ε²)로 ε + (C^p + C^r)ε² 수준의 정책 가치 추정치를 보장하며, 그 외의 경우 손상 수준을 신호로 보낸다.
- 이 리그레트 한계는 단지 손상된 에피소드 수가 아니라 실제 보상(C^r) 및 전이(C^p) 손상 정도에 의존하는 최초의 결과이다.
- 이 프레임워크는 손상에 강건한 표본형 강화 학습에서 가감적 손상 의존성이 가능하다는 것을 입증하며, Lykouris 등(2020)이 제기한 열린 문제를 해결한다.
- EstAll을 표준 보상-무료 탐색 알고리즘으로 대체할 경우 T에 대한 의존성이 악화됨을 확인하여, EstAll이 손상된 환경에서 뛰어난 강건성을 확보하고 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.