Skip to main content
QUICK REVIEW

[논문 리뷰] Regret Bound Balancing and Elimination for Model Selection in Bandits and RL

Aldo Pacchiano, Christoph Dann|arXiv (Cornell University)|2020. 12. 24.
Advanced Bandit Algorithms Research참고 문헌 18인용 수 12
한 줄 요약

이 논문은 확률적 밴딧과 강화학습을 위한 모델 선택 프레임워크를 제안하며, 성능 저하를 방지하기 위해 하위 최적 알고리즘을 제거하는 통계적 검정을 통해 성능 한계를 균형 잡고자 한다. 이는 최적의 유효한 후보 성능 한계의 곱에 작은 곱계수를 곱한 성능 한계를 달성하며, 갭 가정 하에 거의 최적의 성능을 보이며, i.i.d. 가정을 초월한 악성 환경으로의 확장도 가능하다.

ABSTRACT

We propose a simple model selection approach for algorithms in stochastic bandit and reinforcement learning problems. As opposed to prior work that (implicitly) assumes knowledge of the optimal regret, we only require that each base algorithm comes with a candidate regret bound that may or may not hold during all rounds. In each round, our approach plays a base algorithm to keep the candidate regret bounds of all remaining base algorithms balanced, and eliminates algorithms that violate their candidate bound. We prove that the total regret of this approach is bounded by the best valid candidate regret bound times a multiplicative factor. This factor is reasonably small in several applications, including linear bandits and MDPs with nested function classes, linear bandits with unknown misspecification, and LinUCB applied to linear bandits with different confidence parameters. We further show that, under a suitable gap-assumption, this factor only scales with the number of base algorithms and not their complexity when the number of rounds is large enough. Finally, unlike recent efforts in model selection for linear stochastic bandits, our approach is versatile enough to also cover cases where the context information is generated by an adversarial environment, rather than a stochastic one.

연구 동기 및 목표

  • 최적의 설정이 사전에 알려져 있지 않은 상황에서 여러 밴딧 또는 강화학습 알고리즘 중에서 선택하는 문제에 대응한다.
  • 최적의 성능 한계를 알고 있어야 하는 기존 방법의 한계를 극복하며, i.i.d. 환경을 가정하는 데서 자유롭게 한다.
  • 환경의 구조에 대한 사전 지식 없이도 온라인에서 최적의 기본 알고리즘에 적응하는 일반 목적의 마스터 알고리즘을 개발한다.
  • 어떤 기본 알고리즘이 잘못 지정되었더라도, 최적의 유효한 기본 알고리즘 성능 한계와 경쟁 가능한 성능 한계를 달성한다.
  • i.i.d. 가정을 초월한 악성 환경으로 프레임워크를 확장하여, 더 넓은 범위에서의 안정적인 성능을 확보한다.

제안 방법

  • 각각의 후보 성능 한계가 실제로 성립하는지 여부가 불확실한 기본 알고리즘의 집합을 유지한다.
  • 각 라운드에서 모든 남아있는 알고리즘의 후보 성능 한계를 균형 잡는 방식으로 기본 알고리즘을 선택한다.
  • 통계적 검정을 통해 후보 성능 한계를 위반하는 기본 알고리즘을 탐지하고 제거한다.
  • 신뢰구간 위반에 기반해 탐색을 동적으로 조정하는 에포크 기반 균형 서브루틴을 활용한다.
  • 예를 들어, 다양한 차원을 가진 선형 밴딧과 같은 중첩된 모델 클래스나, OFUL의 신뢰수준 파라미터와 같은 하이퍼파라미터 튜닝에 적용한다.
  • 랜덤화된 균형 메커니즘을 통해 악성 환경으로의 확장을 도모하며, 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1최적의 성능 한계를 사전에 알지 못하더라도, 최적의 유효한 후보 성능 한계에 가까운 성능을 달성할 수 있는가?
  • RQ2성능 균형 조절과 제거 전략을 통해, 여러 대안 중에서 최적의 기본 알고리즘을 자동으로 선택할 수 있는가?
  • RQ3다른 기본 알고리즘의 성능 한계 간의 갭이 마스터 알고리즘의 성능에 어떤 영향을 미치는가?
  • RQ4i.i.d. 가정이 성립하지 않는 악성 환경으로도 이 방법을 확장할 수 있는가?
  • RQ5성능 한계의 곱계수는 기본 알고리즘의 수와 복잡도에 따라 어떻게 변화하는가?

주요 결과

  • 제안된 마스터 알고리즘의 총 성능 한계는 최적의 유효한 후보 성능 한계에 작은 곱계수를 곱한 값으로 유계이다.
  • 갭 가정 하에, 반복 횟수가 많아질수록 곱계수는 기본 알고리즘의 수에만 비례하고 복잡도에는 비례하지 않는다.
  • 중첩된 모델 클래스를 가진 선형 밴딧의 경우, 성능 한계는 거의 최적이며, 후행적으로 최적의 기본 알고리즘 성능과 일치한다.
  • 다양한 신뢰수준 파라미터를 가진 OFUL의 경우, 성능 한계는 최적의 구성과 거의 동일하다.
  • 랜덤화된 에포크 균형 서브루틴을 통해 악성 환경으로의 확장이 가능하며, 성능 한계 보장이 유지된다.
  • 성능 한계에는 $\tilde{O}(\sqrt{B}M(d_{\star} + \sqrt{d_{\star}}S_{\star})\sqrt{T})$ 와 같이 비례하는 항이 포함되어 있으며, 여기서 $B$는 잘못 지정된 모델의 수이고, $M$은 기본 알고리즘의 수이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.