Skip to main content
QUICK REVIEW

[논문 리뷰] The K-Nearest Neighbour UCB algorithm for multi-armed bandits with covariates

Henry W. J. Reeve, Joe Mellor|arXiv (Cornell University)|2018. 03. 01.
Advanced Bandit Algorithms Research참고 문헌 17인용 수 6
한 줄 요약

이 논문은 코바리에이트가 있는 다수의 손잡이 밴딧 문제를 위한 k-최근접 이웃 UCB 알고리즘을 제안한다. 이 알고리즘은 거리 공간 내 국소적 이웃 추정을 활용하여 탐색과 이용을 적응적으로 균형 잡는다. 낮은 내재 차원성과 마진 조건 하에서, 차원 또는 시간 영역에 대한 사전 지식이 없이도 최소 최대 최소화된 위험을 달성한다.

ABSTRACT

In this paper we propose and explore the k-Nearest Neighbour UCB algorithm for multi-armed bandits with covariates. We focus on a setting where the covariates are supported on a metric space of low intrinsic dimension, such as a manifold embedded within a high dimensional ambient feature space. The algorithm is conceptually simple and straightforward to implement. The k-Nearest Neighbour UCB algorithm does not require prior knowledge of the either the intrinsic dimension of the marginal distribution or the time horizon. We prove a regret bound for the k-Nearest Neighbour UCB algorithm which is minimax optimal up to logarithmic factors. In particular, the algorithm automatically takes advantage of both low intrinsic dimensionality of the marginal distribution over the covariates and low noise in the data, expressed as a margin condition. In addition, focusing on the case of bounded rewards, we give corresponding regret bounds for the k-Nearest Neighbour KL-UCB algorithm, which is an analogue of the KL-UCB algorithm adapted to the setting of multi-armed bandits with covariates. Finally, we present empirical results which demonstrate the ability of both the k-Nearest Neighbour UCB and k-Nearest Neighbour KL-UCB to take advantage of situations where the data is supported on an unknown sub-manifold of a high-dimensional feature space.

연구 동기 및 목표

  • 기존의 코바리에이트가 있는 다수의 손잡이 밴딧 문제에 대한 UCB 기반 알고리즘의 한계를 해결한다. 특히 유클리드 구조에 의존하고 이분화된 큐브로 분할하는 데 의존하는 점을 개선한다.
  • UCBogram 및 ABSE와 같은 기존 방법에서 내재 차원성과 시간 영역에 대한 사전 지식이 필요로 하는 문제를 해결한다.
  • 코바리에이트 공간의 낮은 내재 차원성과 낮은 노이즈(마진 조건을 통해)에 적응할 수 있는 방법을 개발하여 위험 성능을 향상시킨다.
  • k-NN 프레임워크 내에서 UCB 및 KL-UCB 변형에 대한 이론적 보장을 제공하며, 로그 인자 수준까지 최소 최대 최소화된 성능을 확보한다.
  • 기존 방법이 실패하는 워셔슈타인 또는 에디트 거리로 정의된 비유클리드 메트릭 공간에 적용 가능하게 한다.

제안 방법

  • 기존 코바리에이트의 k-최근접 이웃을 기반으로 거리 공간 내에서 각 암의 기대 보상치를 추정하는 k-최근접 이웃 UCB 알고리즘을 제안한다.
  • k-이웃 영역 내 관측 수의 역수 비례로 증가하는 신뢰 구간 너비를 고려하여 각 암에 대한 상한 신뢰 구간을 구성한다.
  • 메트릭 공간의 구조를 활용해 이웃 영역을 정의함으로써, 워셔슈타인 또는 에디트 거리로 정의된 비유클리드 공간에도 적용 가능하게 한다.
  • Kullback-Leibler 발산 기반의 신뢰 구간을 사용하는 k-NN KL-UCB 변형을 도입하여, 유한한 보상 조건 하에서 더 날카운 신뢰 구간을 확보하고 위험 한계를 더욱 강화한다.
  • 보상 함수의 리프시츠 연속성과 보상 분포에 대한 마진 조건을 가정하여 이론적 분석을 수행한다.
  • 내재 차원과 마진 매개변수에 따라 최적의 비율로 스케일링되는 위험 한계를 유도하며, 로그 인자 수준까지 최소 최대 최소화된 성능를 달성한다.

실험 결과

연구 질문

  • RQ1k-NN 기반의 UCB 알고리즘이 내재 차원성 또는 시간 영역에 대한 사전 지식이 없이도 코바리에이트가 있는 다수의 손잡이 밴딧 문제에서 최소 최대 최소화된 위험을 달성할 수 있는가?
  • RQ2기존의 분할 기반 방법이 실패하는 비유클리드 메트릭 공간에서 k-NN UCB 알고리즘이 어떻게 성능을 발휘하는가?
  • RQ3고차원 특징 공간에 임bedded된 낮은 내재 차원의 다양체에 대해 알고리즘이 얼마나 잘 적응하는가?
  • RQ4유한한 보상 조건과 낮은 노이즈 하에서 k-NN KL-UCB 변형이 표준 k-NN UCB보다 더 날카운 위험 한계를 달성하는가?
  • RQ5마진 조건 하에서 k-NN UCB 알고리즘의 이론적 위험 한계는 무엇이며, 기존 알려진 하한과 어떻게 비교되는가?

주요 결과

  • k-최근접 이웃 UCB 알고리즘은 낮은 내재 차원성과 마진 조건 하에서 로그 인자 수준까지 최소 최대 최소화된 위험 한계를 달성한다.
  • 알고리즘은 코바리에이트의 주변 분포의 내재 차원성 또는 시간 영역에 대한 사전 지식이 필요 없어 적응적이고 실용적이다.
  • k-NN KL-UCB 변형은 KL 발산 기반의 더 날카운 신뢰 구간을 사용함으로써 유한한 보상 조건 하에서 개선된 위험 한계를 달성하며, 경험적 성능이 향상된다.
  • 이론적 분석 결과, 마진 조건 매개변수 $ \nu $ 하에서 위험은 $ O(n^{1 - \frac{\nu+1}{d+2}}) $ 비례로 스케일링되며, 여기서 $ d $ 는 내재 차원이다. 이는 로그 인자 수준까지 알려진 하한과 일치한다.
  • 경험적 결과는 k-NN UCB 및 k-NN KL-UCB가 고차원 특징 공간 내에 존재하는 낮은 차원의 부분다양체를 효과적으로 이용함을 보여주며, 다양체가 알려져 있지 않더라도 성능을 발휘한다.
  • 이 방법은 워셔슈타인 또는 에디트 거리로 정의된 비유클리드 메트릭 공간에도 적용 가능하며, 이전의 분할 기반 알고리즘이 기하학적 왜곡으로 인해 실패하는 곳에서도 유의미하게 작동한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.