Skip to main content
QUICK REVIEW

[논문 리뷰] Impossible Tuning Made Possible: A New Expert Algorithm and Its Applications

Liyu Chen, Haipeng Luo|arXiv (Cornell University)|2021. 02. 01.
Advanced Bandit Algorithms Research참고 문헌 33인용 수 7
한 줄 요약

이 논문은 거울 강하법에 보정 항과 가중 음수 엔트로피 정규화를 도입한 새로운 전문가 알고리즘을 제안함으로써 온라인 학습에서 오랫동안 해결되지 않았던 '불가능한 튜닝' 문제를 해결한다. 이로 인해 모든 전문가 i에 대해 동시에 ˜O(√(ln d) Σₜ(ℓₜ,ᵢ − mₜ,ᵢ)²)의 손실 한계를 확보할 수 있다. 이 방법은 예측 벡터 mₜ를 사용해 적응형 한계로 일반화되며, 기존 결과를 복원하거나 향상시키고, 최소한의 오버헤드로 최적의 기본 알고리즘을 학습하는 마스터 알고리즘을 가능하게 한다.

ABSTRACT

We resolve the long-standing "impossible tuning" issue for the classic expert problem and show that, it is in fact possible to achieve regret $O\left(\sqrt{(\ln d)\sum_t \ell_{t,i}^2} ight)$ simultaneously for all expert $i$ in a $T$-round $d$-expert problem where $\ell_{t,i}$ is the loss for expert $i$ in round $t$. Our algorithm is based on the Mirror Descent framework with a correction term and a weighted entropy regularizer. While natural, the algorithm has not been studied before and requires a careful analysis. We also generalize the bound to $O\left(\sqrt{(\ln d)\sum_t (\ell_{t,i}-m_{t,i})^2} ight)$ for any prediction vector $m_t$ that the learner receives, and recover or improve many existing results by choosing different $m_t$. Furthermore, we use the same framework to create a master algorithm that combines a set of base algorithms and learns the best one with little overhead. The new guarantee of our master allows us to derive many new results for both the expert problem and more generally Online Linear Optimization.

연구 동기 및 목표

  • 모든 전문가에 대해 동시에 적응형 손실 한계를 확보할 수 없었던 전문가 문제의 '불가능한 튜닝' 문제를 해결하기 위해.
  • 다양한 예측 벡터 mₜ에 일반화될 수 있는 통합 알고리즘 프레임워크를 개발하여 기존의 적응형 한계를 복원하거나 향상시키기 위해.
  • 낮은 오버헤드로 최적의 기본 알고리즘을 실시간으로 학습할 수 있는 마스터 알고리즘을 설계하여 온라인 학습에서 새로운 결과를 도출하기 위해.

제안 방법

  • Steinhardt와 Liang(2014)의 영감을 받은 보정 항과 전문가 및 라운드별로 다른 학습률을 갖는 가중 음수 엔트로피 정규화를 포함한 거울 강하법 기반 알고리즘을 제안한다.
  • 표준 다중 가중치 업데이트 형태를 피하기 위해, 가중치를 계산하기 위한 선형 탐색 절차를 도입하여 각 전문가별로 동일하지 않은 튜닝을 가능하게 한다.
  • 손실 한계 분석을 신중하게 수행하여 경계 내의 음수 항을 활용하여 모든 i에 대해 ˜O(√(ln d) Σₜ(ℓₜ,ᵢ − mₜ,ᵢ)²) 보장을 달성한다.
  • 온라인 선형 최적화(OLO)로 프레임워크를 일반화하여 손실의 경로 길이와 분산을 포함한 경계를 유도한다.
  • 알 수 없는 손실 범위와 비제한된 직경을 갖는 비제한 설정에서의 처리를 위해 듀얼링 기법을 적용한다.
  • 여러 개의 기본 알고리즘을 통합하고 실시간으로 가장 성능이 좋은 것을 학습하는 마스터 알고리즘을 설계한다.

실험 결과

연구 질문

  • RQ1모든 전문가에 대해 동시에 적응형 손실 한계를 확보할 수 있는 '불가능한 튜닝' 문제는 해결될 수 있는가?
  • RQ2예측 벡터 mₜ가 주어졌을 때, 단일 알고리즘이 모든 전문가 i에 대해 ˜O(√(ln d) Σₜ(ℓₜ,ᵢ − mₜ,ᵢ)²)의 손실 한계를 달성할 수 있는가?
  • RQ3이 프레임워크는 OLO로 일반화되어 경로 길이와 분산에 대한 새로운 경계를 도출할 수 있는가?
  • RQ4낮은 오버헤드로 최적의 기본 알고리즘을 학습할 수 있는 마스터 알고리즘을 설계할 수 있는가?
  • RQ5알 수 없는 손실 범위와 비제한된 결정 집합을 갖는 비제한 온라인 학습에서 이 알고리즘이 처리할 수 있는가?

주요 결과

  • 제안된 알고리즘은 모든 전문가 i에 대해 동시에 ˜O(√(ln d) Σₜ(ℓₜ,ᵢ − mₜ,ᵢ)²)의 손실 한계를 달성하여 '불가능한 튜닝' 문제를 해결한다.
  • 다양한 예측 벡터 mₜ를 선택함으로써 (A,B)-PROD, ADAPT-ML-PROD, OPTIMISTIC-ADAPT-ML-PROD의 기존 결과를 복원하거나 향상시킨다.
  • OLO에 대해 ˜O(√(r Σₜ⟨u, ℓₜ − mₜ⟩²))의 손실 한계를 달성하며, 여기서 r는 손실 공분산 행렬의 질량이다. 이는 스위칭 손실과 알 수 없는 손실 범위로 일반화된다.
  • 마스터 알고리즘은 T에 대해 로그 수준의 오버헤드로 최적의 기본 알고리즘을 학습할 수 있으며, 전문가 및 OLO 설정 모두에서 새로운 결과를 가능하게 한다.
  • 알 수 없는 리프시츠 조건을 갖는 비제한 학습에서는 듀얼링 기법을 사용해 결정 집합 직경을 적응적으로 설정하여 ˜O(√(r Σₜ⟨u, ℓₜ − mₜ⟩²) + √(D_T B) + G_T ||u||³/²)의 손실 한계를 달성한다.
  • 선수 π를 통해 KL 발산 경쟁자로의 일반화를 지원하며, 간격 손실과 밴딧 설정으로의 확장도 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.