Skip to main content
QUICK REVIEW

[논문 리뷰] Simultaneously Learning Stochastic and Adversarial Episodic MDPs with Known Transition

Tiancheng Jin, Haipeng Luo|arXiv (Cornell University)|2020. 06. 10.
Advanced Bandit Algorithms Research참고 문헌 26인용 수 9
한 줄 요약

이 논문은 전이가 알려진 전이가 알려진 에피소딕 마르코프 결정 과정(MDPs)과 밴딧 피드백을 위한 '양면의 최고' 보장을 갖는 첫 번째 알고리즘을 제시한다. 이는 타살 엔트로피와 로그-바리어 항을 기반으로 한 새로운 하이브리드 정규화항을 후속 정규화된 리더(FTRL) 프레임워크에 통합하여, 스 tochastic 설정에서는 $\omega(\log T)$의 손실을, 적대적 설정에서는 $\omega(\sqrt{T})$의 손실을 달성한다. 이는 손실의 오염 정도를 제어하는 파라미터 $C$를 통해 부드럽게 보간된다. 핵심 기술적 진전은 복잡한 역행렬을 가진 비대칭 헤시안 정규화항을 분석함으로써 자기유지(self-bounding) 손실 경계를 가능하게 한 것이다.

ABSTRACT

This work studies the problem of learning episodic Markov Decision Processes with known transition and bandit feedback. We develop the first algorithm with a ``best-of-both-worlds'' guarantee: it achieves $\mathcal{O}(log T)$ regret when the losses are stochastic, and simultaneously enjoys worst-case robustness with $ ilde{\mathcal{O}}(\sqrt{T})$ regret even when the losses are adversarial, where $T$ is the number of episodes. More generally, it achieves $ ilde{\mathcal{O}}(\sqrt{C})$ regret in an intermediate setting where the losses are corrupted by a total amount of $C$. Our algorithm is based on the Follow-the-Regularized-Leader method from Zimin and Neu (2013), with a novel hybrid regularizer inspired by recent works of Zimmert et al. (2019a, 2019b) for the special case of multi-armed bandits. Crucially, our regularizer admits a non-diagonal Hessian with a highly complicated inverse. Analyzing such a regularizer and deriving a particular self-bounding regret guarantee is our key technical contribution and might be of independent interest.

연구 동기 및 목표

  • 전이가 알려진 스 tochastic 및 적대적 에피소딕 MDPs에서 최적의 손실을 달성하는 단일 알고리즘을 개발하는 것.
  • 이전에는 다중 암초 밴딧에서만 알려진 '양면의 최고' 보장을, 더 복잡한 에피소딕 MDPs 설정으로 확장하는 것.
  • 손실 환경의 구조를 사전에 알지 못해도, FTRL이 스 tochastic 및 적대적 손실 환경에 적응할 수 있도록 하는 정규화항을 설계하는 것.
  • 비대칭 헤시안 정규화항을 분석하여, 온라인 학습에서 점유도 측도 공간에 대해 자기유지 손실 경계를 달성하는 데 기여하는 기술적 혁신을 이룩하는 것.

제안 방법

  • 알고리즘은 점유도 측도 공간에서 후속 정규화된 리더(FTRL) 프레임워크를 사용하며, $-\sum_{s,a} \left(\sqrt{q(s,a)} + \sqrt{q(s) - q(s,a)}\right)$와 로그-바리어 항 $-\sum_{s,a} \log q(s,a)$를 조합한 하이브리드 정규화항을 활용한다.
  • 이 하이브리드 정규화항은 최근 다중 암초 밴딧 및 반-밴딧 분야의 발전에서 영감을 받았으며, 구체적으로 $\nicefrac{1}{2}$-타살 엔트로피와 로그-바리어 정규화에 기반한다.
  • 핵심 기술적 혁신은 비분해형 정규화항을 가진 비대칭 헤시안에 대해 FTRL 손실 경계를 분석하는 데 있다. 이는 새로운 역행렬 헤시안 및 이차 노름 분석이 필요하다.
  • 손실 추정기의 이차 노름이 역행렬 헤시안에 대해 유계임을 증명함으로써 알고리즘이 자기유지 손실 경계를 달성한다.
  • 분석은 상태-행동 쌍에 대해 재귀적 유계 기법을 사용하며, 다중 암초 밴딧에서 [27]의 것과 유사한 갭 조건을 활용한다.
  • 손실의 총 오염 정도가 $C$ 이하일 때, 손실 경계가 $\mathcal{O}(\log T)$와 $\widetilde{\mathcal{O}}(\sqrt{T})$ 사이에서 부드럽게 보간되도록 하기 위해 손실 오염 파라미터 $C$를 도입한다. 이로 인해 중간 설정에서 $\widetilde{\mathcal{O}}(\log T + \sqrt{C})$의 손실 경계를 달성한다.

실험 결과

연구 질문

  • RQ1전이가 알려진 에피소딕 MDPs에서 손실이 스 tochastic일 경우 $\mathcal{O}(\log T)$의 손실을 달성하고, 적대적 설정일 경우 $\widetilde{\mathcal{O}}(\sqrt{T})$의 손실을 달성할 수 있는 단일 알고리즘이 존재할 수 있는가?
  • RQ2다중 암초 밴딧에서만 알려진 '양면의 최고' 보장을, 전이 함수가 알려진 더 복잡한 에피소딕 MDPs 설정으로 확장할 수 있는가?
  • RQ3점유도 측도 공간에서의 온라인 학습에서, 비대칭 헤시안 정규화항을 FTRL 프레임워크에 어떻게 분석하여 자기유지 손실 경계를 도출할 수 있는가?
  • RQ4어떤 정규화항의 구조가 손실 유형을 사전에 알지 못해도 스 tochastic 및 적대적 손실 환경에 적응할 수 있도록 하는가?
  • RQ5손실 오염 파라미터 $C$를 사용하여 스 tochastic 및 적대적 영역 간의 손실 경계를 부드럽게 보간할 수 있는가?

주요 결과

  • 제안된 알고리즘은 손실이 스 tochastic일 경우 $\mathcal{O}(\log T)$의 손실을 달성하며, 이는 스 tochastic MDPs에서 알려진 최고의 갭-의존 경계와 일치한다.
  • 알고리즘은 적대적 설정에서 $\widetilde{\mathcal{O}}(\sqrt{T})$의 손실을 달성하며, 이는 적대적 에피소딕 MDPs 분야에서 현재 최고 수준의 성능이다.
  • 손실의 총 오염 정도가 $C$ 이하일 경우, 알고리즘은 $\widetilde{\mathcal{O}}(\log T + \sqrt{C})$의 부드러운 손실 보간 경계를 제공하여 스 tochastic 및 적대적 영역 간의 격차를 메운다.
  • 핵심 기술적 기여는 비대칭 헤시안을 가진 새로운 하이브리드 정규화항에 대해 자기유지 손실 경계를 분석한 것으로, 이 분야에서 처음으로 이루어지는 분석이다.
  • 분석은 손실 추정기의 이차 노름이 역행렬 헤시안에 대해 유계임을 입증하며, $\mathbb{E}[\|\widehat{\ell}_t\|^2_{\nabla^{-2}\phi_H(q_t)}] \leq 4\sqrt{L|S||A|}$로 유계임을 보여, 엄밀한 손실 제어를 가능하게 한다.
  • 비대칭 헤시안의 복잡한 역행렬을 가진 하이브리드 정규화항은 알고리즘의 안정성과 자기유지 성질을 가능하게 하며, $\nicefrac{1}{2}$-타살 엔트로피와 로그-바리어 항의 조합이 이에 필수적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.