Skip to main content
QUICK REVIEW

[논문 리뷰] Fine-Grained Gap-Dependent Bounds for Tabular MDPs via Adaptive Multi-Step Bootstrap

Haike Xu, Tengyu Ma|arXiv (Cornell University)|2021. 02. 09.
Advanced Bandit Algorithms Research참고 문헌 26인용 수 12
한 줄 요약

이 논문은 표본 기반 MDP에 대해 $|Z_{\text{mul}}|/\Delta_{\text{min}}$ 와 하위 최적성 갭의 역수 합에 비례하는 갭-의존적 리그레트 한계를 달성하는 모델 자유 알고리즘인 적응형 다단계 부트스트랩(AMB)을 소개한다. UCB 기반 방법과 달리, AMB는 $S/\Delta_{\text{min}}$ 과도한 탐색 페널티를 피하며, 갭-의존적 설정에서 강화 학습과 문맥적 밴디트 간의 형식적 분리를 입증한다.

ABSTRACT

This paper presents a new model-free algorithm for episodic finite-horizon Markov Decision Processes (MDP), Adaptive Multi-step Bootstrap (AMB), which enjoys a stronger gap-dependent regret bound. The first innovation is to estimate the optimal $Q$-function by combining an optimistic bootstrap with an adaptive multi-step Monte Carlo rollout. The second innovation is to select the action with the largest confidence interval length among admissible actions that are not dominated by any other actions. We show when each state has a unique optimal action, AMB achieves a gap-dependent regret bound that only scales with the sum of the inverse of the sub-optimality gaps. In contrast, Simchowitz and Jamieson (2019) showed all upper-confidence-bound (UCB) algorithms suffer an additional $Ω\left(\frac{S}{Δ_{min}} ight)$ regret due to over-exploration where $Δ_{min}$ is the minimum sub-optimality gap and $S$ is the number of states. We further show that for general MDPs, AMB suffers an additional $\frac{|Z_{mul}|}{Δ_{min}}$ regret, where $Z_{mul}$ is the set of state-action pairs $(s,a)$'s satisfying $a$ is a non-unique optimal action for $s$. We complement our upper bound with a lower bound showing the dependency on $\frac{|Z_{mul}|}{Δ_{min}}$ is unavoidable for any consistent algorithm. This lower bound also implies a separation between reinforcement learning and contextual bandits.

연구 동기 및 목표

  • 표본 기반 MDP에서 UCB 기반 방법이 악영향을 미치는 $S/\Delta_{\text{min}}$ 리그레트 항을 피할 수 있는 비-UCB 알고리즘의 존재 여부라는 열린 질문을 해결하기 위해.
  • 모델 자유 알고리즘을 개발하여, $S/\Delta_{\text{min}}$ 가 아닌 하위 최적성 갭의 역수 합과 $|Z_{\text{mul}}|/\Delta_{\text{min}}$ 에 비례하는 갭-의존적 리그레트 한계를 달성하기 위해.
  • 모든 일관된 알고리즘에 대해 $|Z_{\text{mul}}|/\Delta_{\text{min}}$ 항이 필수적임을 보여주는 하한선을 설정하여, 갭-의존적 설정에서 강화 학습과 문맥적 밴디트 간의 형식적 분리를 입증하기 위해.

제안 방법

  • AMB는 표본 효율성을 향상시키기 위해 낙관적 부트스트랩과 적응형 다단계 몬테카를로 시뮬레이션을 결합하여 최적의 $Q$-함수를 추정한다.
  • 비지배적 행동들 중에서 가장 긴 신뢰구간 길이를 가진 행동을 선택함으로써, 모호한 상태에서의 과도한 탐색을 줄인다.
  • 추정된 불확실성에 기반해 부트스트랩 수평선을 동적으로 조정함으로써, 문제의 구조에 맞는 세밀한 탐색을 가능하게 한다.
  • 값 추정에서 낙관성과 분산 감소를 균형 잡는 데 사용되는 새로운 신뢰구간 구성 방법을 활용한다.
  • 상태-행동 쌍을 $Z_{\text{mul}}$(유일한 최적 행동이 아닌 것들)와 $Z_{\text{opt}}$(유일한 최적 행동)로 분류하고, 리그레트 분석을 $Z_{\text{mul}}$ 에 집중한다.
  • 이론적 분석은 브레타놀-후버 부등식과 상대 엔트로피 한계를 조합하여 어려운 MDP 인스턴스에 대한 리그레트의 하한선을 유도한다.

실험 결과

연구 질문

  • RQ1비-UCB 알고리즘이 표본 기반 MDP에서 UCB 기반 방법이 악영향을 미치는 $S/\Delta_{\text{min}}$ 과도한 탐색 페널티 없이 갭-의존적 리그레트를 달성할 수 있는가?
  • RQ2갭-의존적 설정에서 일관된 알고리즘에 대해 $|Z_{\text{mul}}|/\Delta_{\text{min}}$ 항이 피할 수 없는가?
  • RQ3MDP에서 최적 행동이 유일하지 않은 경우가 존재할 때, 리그레트 복잡성 측면에서 강화 학습과 문맥적 밴디트 간의 근본적인 차이가 발생하는가?
  • RQ4모델 자유 알고리즘이 $S/\Delta_{\text{min}}$ 가 아닌 하위 최적성 갭의 역수 합과 $|Z_{\text{mul}}|/\Delta_{\text{min}}$ 에 비례하는 리그레트 한계를 달성할 수 있는가?
  • RQ5어떤 일관된 알고리즘에 대해 표본 기반 MDP의 리그레트에서 $|Z_{\text{mul}}|$ 에 대한 최적의 의존성은 무엇인가?

주요 결과

  • AMB는 $\widetilde{O}\left(\sum_{(s,a,h)} \frac{1}{\Delta_h(s,a)} + \frac{|Z_{\text{mul}}|}{\Delta_{\text{min}}} + SA \right) \cdot \mathrm{poly}(H) \log K$ 의 갭-의존적 리그레트 한계를 달성하며, 이는 UCB 기반 방법에 존재하는 $S/\Delta_{\text{min}}$ 항을 피한다.
  • 알고리즘의 리그레트는 $S/\Delta_{\text{min}}$ 에 비례하지 않으며, Simchowitz와 Jamieson(2019)이 제기한 열린 질문인 이러한 의존성이 제거될 수 있는지를 해결한다.
  • 어려운 인스턴스에서 $|Z_{\text{mul}}| \approx SA/2$ 를 만족하는 경우, 모든 일관된 알고리즘이 최소 $\Omega\left(\frac{SA \ln K}{32 \Delta_{\text{min}}}\right)$ 의 리그레트를 겪어야 한다는 하한선이 확립되었으며, 이는 $|Z_{\text{mul}}|/\Delta_{\text{min}}$ 항이 피할 수 없다는 것을 입증한다.
  • 하한선은 문맥적 밴디트가 이러한 항을 겪지 않기 때문에, 갭-의존적 설정에서 강화 학습과 문맥적 밴디트 간의 형식적 분리를 암시한다.
  • 분석 결과 $|Z_{\text{mul}}|/\Delta_{\text{min}}$ 항이 필수적임이 확인되었으며, 제안된 알고리즘이 갭-의존적 설정에서 로그 인자 외에는 최적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.