Skip to main content
QUICK REVIEW

[논문 리뷰] From Coin Betting to Parameter-Free Online Learning

Francesco Orabona, Dávid Pál|arXiv (Cornell University)|2016. 02. 12.
Advanced Bandit Algorithms Research참고 문헌 30인용 수 4
한 줄 요약

이 논문은 힐버트 공간에서의 파rameter-free 온라인 학습과 전문가 조언을 통합하기 위해, 둘 다 온라인 동전 베판 알고리즘으로부터 유도한다. Krichevsky-Trofimov 기반의 베판 전략을 사용하여, 힐버트 공간에서는 $O(\norm{u}\tsqrt{T \tlog(1+T\norm{u})})$의 손실을, 전문가 조언에서는 $O(\tsqrt{T(1 + \KL{u}{\pi})})$의 손실을 달성하며, 이는 어떤 하이퍼파rameter도 조정이 필요하지 않다.

ABSTRACT

In the recent years a number of parameter-free algorithms for online linear optimization over Hilbert spaces and for learning with expert advice have been developed. While these two families of algorithms might seem different to a distract eye, the proof methods are indeed very similar, making the reader wonder if such a connection is only accidental. In this paper, we unify these two families, showing that both can be instantiated from online coin betting algorithms. We present two new reductions from online coin betting to online linear optimization over Hilbert spaces and to learning with expert advice. We instantiate our framework using a betting algorithm based on the Krichevsky-Trofimov estimator. We obtain a simple algorithm for online linear optimization over any Hilbert space with $O( orm{u}\sqrt{T \log(1+T orm{u}}))$ regret with respect to any competitor $u$. For learning with expert advice we obtain an algorithm that has $O(\sqrt{T (1 + \KL{u}{\pi})})$ regret against any competitor $u$ and where $\KL{u}{\pi}$ is the Kullback-Leibler divergence between algorithm's prior distribution $\pi$ and the competitor. In both cases, no parameters need to be tuned.

연구 동기 및 목표

  • 힐버트 공간에서의 파rameter-free 온라인 학습과 전문가 조언을 동일한 프레임워크 아래 통합하기 위해.
  • 두 문제 모두 온라인 동전 베판 알고리즘으로 환원될 수 있음을 보여주기 위해.
  • 기존의 파rameter-free 알고리즘에서 하이퍼파rameter 조정이 필요 없도록 제거하기 위해.
  • 베판 프레임워크에서 Krichevsky-Trofimov 추정기의 사용을 통해 통합된 이론적 기반을 제공하기 위해.

제안 방법

  • 새로운 환원 메커니즘을 통해 힐버트 공간에서의 온라인 선형 최적화를 온라인 동전 베판으로 환원한다.
  • 유사한 환원 전략을 사용하여 전문가 조언 학습을 온라인 동전 베판으로 환원한다.
  • Krichevsky-Trofimov 추정기를 활용하여 최적의 손실 보장을 갖는 파rameter-free 베판 알고리즘을 구성한다.
  • 동전 베판 프레임워크에서의 누적 손실을 분석함으로써 두 설정 모두에 대한 손실 한계를 유도한다.
  • 전문가 조언에서 상대적 성능을 측정하기 위해 사전 분포 $\pi$와 경쟁자 분포 $u$ 사이의 Kullback-Leibler 발산을 사용한다.
  • 하이퍼파rameter 조정이 필요 없음을 입증하며, 알고리즘이 문제의 구조에 자동으로 적응함을 확립한다.

실험 결과

연구 질문

  • RQ1힐버트 공간에서의 온라인 선형 최적화와 전문가 조언 학습이 동일한 알고리즘 프레임워크 아래 통합될 수 있는가?
  • RQ2이 두 유형의 알고리즘 간의 증명 기법 유사성이 우연인가, 아니면 구조적으로 근본적인가?
  • RQ3온라인 동전 베판이 다양한 온라인 학습 설정에서 파rameter-free 알고리즘을 구성하는 기초 원천이 될 수 있는가?
  • RQ4Krichevsky-Trofimov 추정기 기반의 베판 알고리즘을 사용할 경우, 이러한 설정에서 달성 가능한 손실 한계는 무엇인가?
  • RQ5결과로 도출된 알고리즘이 수동적인 하이퍼파rameter 조정 없이 최적의 손실을 달성할 수 있는가?

주요 결과

  • 제안된 알고리즘은 임의의 힐버트 공간에서의 온라인 선형 최적화에서, 임의의 경쟁자 $u$에 대해 $O(\norm{u}\tsqrt{T \tlog(1+T\norm{u})})$의 손실을 달성한다.
  • 전문가 조언 학습의 경우, 알고리즘은 $O(\tsqrt{T(1 + \KL{u}{\pi})})$의 손실을 달성하며, 여기서 $\KL{u}{\pi}$는 사전 $\pi$와 경쟁자 $u$ 사이의 Kullback-Leibler 발산이다.
  • 손실 한계는 로그 인자 외에는 최적이며, 어떤 하이퍼파rameter도 조정이 필요하지 않다.
  • 이 프레임워크는 동일한 동전 베판 기반으로 두 개의 서로 다른 파rameter-free 알고리즘 유형을 성공적으로 통합한다.
  • Krichevsky-Trofimov 추정기의 사용은 두 설정 모두에서 적응적이고 파rameter-free 성능을 가능하게 한다.
  • 동전 베판에서 두 온라인 학습 문제로의 환원은 일반적이며, 다른 베판 전략으로도 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.