Skip to main content
QUICK REVIEW

[논문 리뷰] Optimal Non-Asymptotic Lower Bound on the Minimax Regret of Learning with Expert Advice

Francesco Orabona, Dávid Pál|arXiv (Cornell University)|2015. 11. 06.
Advanced Bandit Algorithms Research참고 문헌 4인용 수 10
한 줄 요약

이 논문은 길이 $n$인 $d$개의 독립적인 대칭 랜덤 워크의 기대 최댓값에 대한 날카운 감소 하한을 유도함으로써, 전문가 조언이 있는 온라인 학습에서 최소 최대 손실에 대한 비점점 하한을 확립한다. 주요 기여는 渐近적으로 최적의 상수 $\sqrt{2\ln d}$를 복원하는 최적의 하한을 제공하며, 유한한 $n$과 $d$에 대해 구체적인 비점점 손실 하한을 제공한다는 점이다. 분석은 밀의 비율을 통한 가우시안 및 라데마처 랜덤 변수의 尾確率에 대한 새로운 하한을 활용하여, 전문가 조언 설정에서 i.i.d. 랜덤 변수의 최댓값에 적용된다.

ABSTRACT

We prove non-asymptotic lower bounds on the expectation of the maximum of $d$ independent Gaussian variables and the expectation of the maximum of $d$ independent symmetric random walks. Both lower bounds recover the optimal leading constant in the limit. A simple application of the lower bound for random walks is an (asymptotically optimal) non-asymptotic lower bound on the minimax regret of online learning with expert advice.

연구 동기 및 목표

  • 전문가 조언이 있는 온라인 학습에서 알려진 점점 하한과 비점점 하한 사이의 격차를 메우기 위해.
  • 길이 $n$인 $d$개의 독립적인 대칭 랜덤 워크의 기대 최댓값에 대한 비점점 하한을 유도하기 위해.
  • 큰 $n$과 $d$에 대해 알려진 점점 최적 상수 $\sqrt{2\ln d}$를 재현하는 최소 최대 손실에 대한 하한을 확립하기 위해.
  • 밀의 비율 부등식을 사용하여 i.i.d. 랜덤 변수의 꼬리와 최댓값에 대한 명시적이고 비점점 하한을 유도하기 위해.

제안 방법

  • 보이드(1959)의 부등식의 단순화된 형태를 사용하여 표준 정규 분포에 대한 밀의 비율에 대한 새로운 하한을 유도한다.
  • 표준 정규 분포의 꼬리 확률에 대한 하한을 적용하여, i.i.d. $N(0,\sigma^2)$ 변수의 기대 최댓값에 대한 하한을 도출한다.
  • 대칭성과 농도 논리적 접근을 사용하여 임계값 이하일 때 가우시안의 조건부 기대값을 유계한다.
  • 길이 $n$인 $d$개의 독립적인 대칭 랜덤 워크의 기대 최댓값을 분석하여, 이산 케이스로 가우시안 결과를 번역한다.
  • 온라인 학습에 전문가 조언이 있는 문제에 랜덤 워크 하한을 적용하기 위해 $d$개의 랜덤 워크의 최댓값으로의 감소를 사용한다.
  • 커플링 논리를 사용하여 어떤 알고리즘의 손실을 $d$개의 대칭 랜덤 워크의 기대 최댓값과 관련지어, 손실에 대한 하한을 확립한다.

실험 결과

연구 질문

  • RQ1길이 $n$인 $d$개의 독립적인 대칭 랜덤 워크의 기대 최댓값에 대한 가장 날카운 비점점 하한은 무엇인가요?
  • RQ2점점 상수 $\sqrt{2\ln d}$를 복원하는, 가우시안의 기대 최댓값에 대한 비점점 하한을 도출할 수 있는가요?
  • RQ3랜덤 워크의 최댓값에 대한 유도된 하한이, 전문가 조언이 있는 온라인 학습에서 알려진 점점 최적 상수를 재현하는 최소 최대 손실 하한을 제공하는가요?
  • RQ4밀의 비율을 어떻게 사용하여 i.i.d. 랜덤 변수의 꼬리와 최댓값에 대한 명시적이고 비점점 하한을 도출할 수 있는가요?

주요 결과

  • i.i.d. $N(0,\sigma^2)$ 변수에 대해 $\mathbf{E}[\max_{1\leq i\leq d} X_i]$에 대한 비점점 하한이 확립되었으며, 주요 항 $\sigma\sqrt{2\ln d}$가 점점 상수와 일치한다.
  • $\Omega(\sigma\sqrt{\log d})$의 하한이 증명되었으며, 이는 점점적으로 최적의 $\sqrt{2\ln d}$ 인자를 복원한다.
  • 길이 $n$인 대칭 랜덤 워크에 대해, 기대 최댓값은 $\mathbf{E}[\max_{1\leq i\leq d} Z^{(n)}_i] = \Omega(\sqrt{n\log d})$를 만족하며, 점점적 근사에서 주요 항 $\sqrt{2n\ln d}$를 포함한다.
  • 이 하한은 전문가 조언이 있는 온라인 학습에 적용되어, 알려진 점점 최적 상수 $\sqrt{2\ln d}$를 재현하는 비점점 손실 하한을 제공한다.
  • 손실 하한은 $\operatorname{Regret}^{(d)}(n) \geq \frac{1 - \exp(-\frac{\sqrt{\ln d}}{3.1\sqrt{2\pi}})}{\sqrt{\psi(\frac{1.6\sqrt{\ln d}}{2\sqrt{n}})}} \cdot \frac{\sqrt{n}}{2}(\sqrt{2\ln d - 2\ln\ln d} - 1) - \frac{\sqrt{n}}{2}$로 표현되며, $n \geq 7$ 및 $2 \leq d \leq \exp(n/3)$일 때 유효하다.
  • 유도된 하한은 $n, d \to \infty$일 때 점점 주요 상수 $\sqrt{2\ln d}$를 복원하므로, 알려진 상한의 날카운성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.