Skip to main content
QUICK REVIEW

[논문 리뷰] Top-$k$ eXtreme Contextual Bandits with Arm Hierarchy

Rajat Sen, Alexander Rakhlin|arXiv (Cornell University)|2021. 02. 15.
Advanced Bandit Algorithms Research참고 문헌 45인용 수 4
한 줄 요약

이 논문은 수백만 개의 암을 가진 환경에서 효율적인 탐색과 리그레트 최소화를 달성하기 위해 암 계층을 활용하는 계층적 top-$k$ eXtreme 컨텍스추얼 밴딧 알고리즘을 제안한다. 레이블 임베딩 기반의 트리로 암을 구조화하고 선형 회귀를 사용한 역 갭 가중치(IGW)를 적용함으로써, 총 암 수에 대한 계산 및 리그레트 의존도를 감소시켰다. 300만 개의 암을 가진 데이터셋에서 평균 추론 시간은 7.9ms로 이전 방법 대비 100배 빠르게 구현되었다.

ABSTRACT

Motivated by modern applications, such as online advertisement and recommender systems, we study the top-$k$ extreme contextual bandits problem, where the total number of arms can be enormous, and the learner is allowed to select $k$ arms and observe all or some of the rewards for the chosen arms. We first propose an algorithm for the non-extreme realizable setting, utilizing the Inverse Gap Weighting strategy for selecting multiple arms. We show that our algorithm has a regret guarantee of $O(k\sqrt{(A-k+1)T \log (|\mathcal{F}|T)})$, where $A$ is the total number of arms and $\mathcal{F}$ is the class containing the regression function, while only requiring $ ilde{O}(A)$ computation per time step. In the extreme setting, where the total number of arms can be in the millions, we propose a practically-motivated arm hierarchy model that induces a certain structure in mean rewards to ensure statistical and computational efficiency. The hierarchical structure allows for an exponential reduction in the number of relevant arms for each context, thus resulting in a regret guarantee of $O(k\sqrt{(\log A-k+1)T \log (|\mathcal{F}|T)})$. Finally, we implement our algorithm using a hierarchical linear function class and show superior performance with respect to well-known benchmarks on simulated bandit feedback experiments using extreme multi-label classification datasets. On a dataset with three million arms, our reduction scheme has an average inference time of only 7.9 milliseconds, which is a 100x improvement.

연구 동기 및 목표

  • 수백만 개의 암을 포함하는 매우 큰 암 수를 가진 top-$k$ 컨텍스추얼 밴딧 문제에서의 확장성 문제를 해결한다.
  • 암 총 수 $A$에 따라 성능이 급격히 떨어지는 표준 알고리즘의 계산 및 리그레트 비효율성을 해결한다.
  • 보상 함수의 구조적 상관관계를 활용하기 위해 실용적인 암 계층 모델을 도입하여 통계적 및 계산적 효율성을 향상시킨다.
  • $A$에 대해 하위선형 의존도를 가지며, 동시에 단계당 $\tilde{O}(A)$의 계산 복잡도를 유지하면서 낮은 리그레트를 달성한다.
  • 엄청난 암 수를 가진 실제 eXtreme 다라벨 분류 데이터셋에서의 경험적 우수성을 입증한다.

제안 방법

  • PIFA를 통해 추출한 레이블 임베딩을 기반으로 재귀적 2-클러스터링을 사용해 의미적으로 유사한 암들을 그룹화하는 계층적 트리로 암을 구조화한다.
  • 선택된 암을 안내하기 위해 소량의 별도 데이터셋에서 훈련된 일대다 선형 분류기로 각 내부 노드에서 라우팅 함수를 정의한다.
  • 계층적 탐색을 지원하기 위해 다중 암 설정에 적합하게 수정된 역 갭 가중치(IGW) 전략을 사용해 각 시간 단계에서 $k$개의 암을 선택한다.
  • 온라인 피드백을 이용해 보상 추정을 위해 각 노드 및 리프에서 선형 회귀 모델($\tilde{f}(x,\tilde{a}) = \nu_{\tilde{a}}^T[x;1]$)을 훈련한다.
  • 효과적인 암을 식별하기 위해 트리 기반 빔 서치를 구현하며, 비엽노드가 선택된 경우 하위 트리에서 무작위 샘플링을 수행한다.
  • C++와 Eigen을 사용해 효율적인 추론을 구현하여 대규모 데이터셋에서 저지연 배포를 가능하게 한다.

실험 결과

연구 질문

  • RQ1암 공간 내 계층적 구조가 각 컨텍스트에서 고려하는 효과적 암 수를 줄여 계산 및 통계적 효율성을 향상시킬 수 있는가?
  • RQ2역 갭 가중치(IGW) 전략은 eXtreme 컨텍스추얼 밴딧 문제에서 top-$k$ 암 선택을 지원하도록 어떻게 확장할 수 있는가?
  • RQ3제안된 알고리즘의 이론적 리그레트 한계는 $A$, $k$, $T$에 따라 어떻게 변화하는가?
  • RQ4대규모 데이터셋에서 리그레트 성능을 희생시키지 않고 계층적 모델이 실용적인 속도 향상을 달성할 수 있는가?
  • RQ5실제 다라벨 데이터셋에서 표준 기준 모델($\epsilon$-greedy, Boltzmann, IGW)과 비교해 리그레트 및 추론 효율성 측면에서 알고리즘이 어떻게 성능을 냈는가?

주요 결과

  • 제안된 알고리즘은 eXtreme 환경에서 $O(k\sqrt{(\log A - k + 1)T\log(|\mathcal{F}|T)})$의 리그레트 한계를 달성하며, $A$에 대해 로그 의존도를 가지며 선형 의존도가 아니다.
  • 300만 개의 암을 가진 데이터셋에서 평균 추론 시간은 7.9밀리초로 기존 방법 대비 100배 빨라졌다.
  • 계층적 구조 덕분에 각 컨텍스트당 관련 암 수가 크게 감소하여 효율성과 확장성 향상이 이루어졌다.
  • Eurlex-4k 데이터셋에서의 하이퍼파rameter 튜닝 결과 최적의 파라미터로 $C=1.0$, $\beta=1.0$, $\epsilon=0.167$를 확보하였다.
  • 모의 밴딧 피드백 실험에서 표준 기준 모델보다 뛰어난 리그레트 및 추론 성능을 보이며, 대규모 다라벨 데이터셋에서 뛰어난 성능을 입증하였다.
  • 이론적 리그레트 보장은 유지하면서도 실용적 효율성을 확보하여, 극한의 컨텍스추얼 밴딧 문제에서 이론과 실무 간 격차를 메웠다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.