Skip to main content
QUICK REVIEW

[논문 리뷰] Achieving All with No Parameters: Adaptive NormalHedge

Haipeng Luo, Robert E. Schapire|arXiv (Cornell University)|2015. 02. 20.
Advanced Bandit Algorithms Research참고 문헌 27인용 수 9
한 줄 요약

이 논문은 전문가 수나 손실 특성에 대한 사전 지식 없이도, 적대적 환경과 확률적 환경에서 동시에 최적의 리그레트를 달성하는 파라미터 없는 온라인 학습 알고리즘인 AdaNormalHedge를 소개한다. NormalHedge.DT의 개선된 변종으로, 알려지지 않은 고정된 경쟁자에 대한 상대 엔트로피와 누적순간 리그레트를 기반으로 한 리그레트 한계를 제공함으로써 전문가 조언 및 수면 전문가 설정에서의 열린 문제를 해결하며, 강력한 이론적 보장을 제공한다.

ABSTRACT

We study the classic online learning problem of predicting with expert advice, and propose a truly parameter-free and adaptive algorithm that achieves several objectives simultaneously without using any prior information. The main component of this work is an improved version of the NormalHedge.DT algorithm (Luo and Schapire, 2014), called AdaNormalHedge. On one hand, this new algorithm ensures small regret when the competitor has small loss and almost constant regret when the losses are stochastic. On the other hand, the algorithm is able to compete with any convex combination of the experts simultaneously, with a regret in terms of the relative entropy of the prior and the competitor. This resolves an open problem proposed by Chaudhuri et al. (2009) and Chernov and Vovk (2010). Moreover, we extend the results to the sleeping expert setting and provide two applications to illustrate the power of AdaNormalHedge: 1) competing with time-varying unknown competitors and 2) predicting almost as well as the best pruning tree. Our results on these applications significantly improve previous work from different aspects, and a special case of the first application resolves another open problem proposed by Warmuth and Koolen (2014) on whether one can simultaneously achieve optimal shifting regret for both adversarial and stochastic losses.

연구 동기 및 목표

  • 사전 지식 없이 적대적 및 확률적 손실 환경에 모두 적응하는 진정한 파라미터 없는 온라인 학습 알고리즘을 개발하는 것.
  • ε-분위수 리그레트 및 상대 엔트로피 기반 리그레트 한계를 포함한 전문가 조언 문헌에서의 열린 문제를 해결하는 것.
  • 시간에 따라 변화하는 전문가 가용성에 적응할 수 있도록 알고리즘을 수면 전문가 설정으로 확장하는 것.
  • 적응형 리그레트 및 최적의 절단 트리 예측과 같은 실용적 응용 분야에서 리그레트 한계를 향상시키는 것.

제안 방법

  • 알고리즘은 NormalHedge.DT의 개선된 변종인 AdaNormalHedge로, 순간 리그레트 크기를 기반으로 한 새로운 리그레트 분해를 통해 가중치를 동적으로 조정한다.
  • 누적순간 리그레트 크기 기반의 리그레트 한계를 도입하여, 항상 NormalHedge.DT의 한계 이내이며, 이차적 한계 성능을 충족시킨다.
  • 경쟁자와 플레이어의 사전 믿음 간의 상대 엔트로피 기반 리그레트를 보장함으로써, 모든 고정된 전문가의 볼록 조합과의 보편적 경쟁력을 확보한다.
  • 시간에 따라 변화하는 전문가 가용성을 모델링하고 절단 트리를 사용한 동적 전문가 표현을 통해 수면 전문가 설정으로 확장한다.
  • 적응형 리그레트 및 최적의 절단 트리 문제에 적용하여, $L^*$ 또는 $m$의 사전 지식이 없는 새로운 시간에 따라 변화하는 학습률 메커니즘을 도입한다.
  • 이론적 분석을 통해 리그레트 한계가 $\hat{O}\Big{(}\sqrt{m{\tilde{L}}^{*}\ln(N_{T}/m)}\Big{)}$임을 입증하며, ${\tilde{L}}^{*}$는 양의 손실 갭이다.

실험 결과

연구 질문

  • RQ1단일 파라미터 없는 알고리즘이 사전 지식 없이도 적대적 및 확률적 손실 환경에서 모두 최적의 리그레트를 달성할 수 있는가?
  • RQ2전문가 조언 문제에서 어떤 알려지지 않은 고정된 경쟁자에 대해서도 상대 엔트로피 기반 리그레트 한계를 달성할 수 있는가?
  • RQ3시간에 따라 변화하는 전문가 가용성과 총 전문가 수가 알려지지 않은 상황에서도 알고리즘을 수면 전문가 설정으로 확장할 수 있는가?
  • RQ4AdaNormalHedge는 Warmuth와 Koolen의 열린 문제를 해결하여, 적대적 및 확률적 손실 모두에 대해 최적의 적응형 리그레트를 달성할 수 있는가?
  • RQ5기존 방법에 비해 $L^*$ 또는 $m$의 지식이 없이도 최적의 절단 트리 예측 문제에서 성능을 뛰어나게 할 수 있는가?

주요 결과

  • AdaNormalHedge는 $\hat{O}\Big{(}\sqrt{m{\tilde{L}}^{*}\ln(N_{T}/m)}\Big{)}$의 리그레트 한계를 달성하며, $N_T \ll N$일 경우 이전의 한계보다 훨씬 더 날카럽다.
  • 알고리즘은 Chaudhuri 등(2009)과 Chernov 및 Vovk(2010)의 열린 문제를 해결하여, 어떤 고정된 경쟁자에 대해서도 상대 엔트로피 기반 리그레트 한계를 제공한다.
  • 손실 패tern의 사전 지식 없이도 확률적 환경에서는 거의 일정한 리그레트를 보장하고, 경쟁자의 손실이 낮을 경우 작은 리그레트를 달성한다.
  • 알고리즘은 효율적이며, 라운드당 $O(\|x_t\|_{\mathcal{G}})$의 시간과 $O(N_T)$의 공간을 요구하며, 전문가 수나 $L^*$를 알 필요가 없다.
  • 최적의 절단 트리 문제에서는 $L^*$나 $m$을 알지 못함에도 불구하고, 기존의 동적 프로그래밍 접근 방식과 비교해도 최적의 $O(\sqrt{mL^*})$ 한계에 근접한 리그레트 한계를 달성한다.
  • Warmuth와 Koolen(2014)의 열린 문제를 해결하여, 단일 알고리즘으로 적대적 및 확률적 손실 모두에 대해 최적의 이동 리그레트를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.