Skip to main content
QUICK REVIEW

[논문 리뷰] The Multi-fidelity Multi-armed Bandit

Kirthevasan Kandasamy, Gautam Dasarathy|arXiv (Cornell University)|2016. 10. 30.
Advanced Bandit Algorithms Research인용 수 10
한 줄 요약

이 논문은 각 암이 다양한 정밀도로 샘플링 가능한 스토케스틱 다중 암 락키 문제를 위한 다중 정밀도 상한 신뢰도 알고리즘인 MF-UCB를 제안한다. 각 정밀도 수준은 다른 비용과 편향된 추정치를 가진다. 저렴한 정밀도의 근사치를 활용해 부적절한 암을 신속히 제거함으로써 MF-UCB는 기존 UCB 대비 정규화를 감소시키며, 이론적 경계 내에서 거의 최적의 성능을 달성하고, 합성 문제에서 뛰어난 경험적 성과를 보여준다.

ABSTRACT

We study a variant of the classical stochastic $K$-armed bandit where observing the outcome of each arm is expensive, but cheap approximations to this outcome are available. For example, in online advertising the performance of an ad can be approximated by displaying it for shorter time periods or to narrower audiences. We formalise this task as a multi-fidelity bandit, where, at each time step, the forecaster may choose to play an arm at any one of $M$ fidelities. The highest fidelity (desired outcome) expends cost $λ^{(m)}$. The $m^{ ext{th}}$ fidelity (an approximation) expends $λ^{(m)} < λ^{(M)}$ and returns a biased estimate of the highest fidelity. We develop MF-UCB, a novel upper confidence bound procedure for this setting and prove that it naturally adapts to the sequence of available approximations and costs thus attaining better regret than naive strategies which ignore the approximations. For instance, in the above online advertising example, MF-UCB would use the lower fidelities to quickly eliminate suboptimal ads and reserve the larger expensive experiments on a small set of promising candidates. We complement this result with a lower bound and show that MF-UCB is nearly optimal under certain conditions.

연구 동기 및 목표

  • 비용이 증가하고 편향이 감소하는 다양한 정밀도로 암을 샘플링할 수 있는 다중 정밀도 밴디트 설정을 정식화한다.
  • 고정밀도 결과가 비싸지만 저비용이고 편향된 근사치가 이용 가능한 상황에서 탐색과 이용의 상충 문제를 다룬다.
  • 탐색에는 낮은 정밀도를 적극적으로 활용하고, 유망한 암에 대해서만 고정밀도 쿼리를 예약하는 알고리즘을 개발한다.
  • 제안된 방법의 정규화를 이론적으로 특성화하고, 특정 조건 하에서 거의 최적이 되는 것을 보여준다.
  • MF-UCB가 고정밀도 추출 횟수를 줄이며 누적 정규화를 더 낮게 달성함으로써 표준 UCB보다 뛰어난 성능을 보임을 경험적으로 검증한다.

제안 방법

  • MF-UCB는 샘플링의 정밀도 수준과 비용을 고려한 신뢰구간을 포함함으로써 고전적 UCB 원리를 확장한다.
  • 알고리즘은 각 암에 대해 각 정밀도 수준에서 별도의 신뢰구간을 유지하며, 높은 정밀도일수록 더 좁은 구간을 가진다.
  • 계층적 선택 전략을 사용한다: 낮은 정밀도는 초기에 예상 수익이 낮은 암을 식별하고 제거하는 데 사용된다.
  • 추정된 수익 갭과 비용 대 분산 비율에 기반해 샘플링 예산을 정밀도 수준 간에 동적으로 할당한다.
  • 각 정밀도 수준 m에서의 추정 성능에 따라 암을 그룹화하는 집합 $\mathcal{K}^{(m)}$ 을 정의함으로써 체계적인 탐색을 가능하게 한다.
  • 이론적 분석은 수익 편향과 분산에 대한 가정에 기반하며, 변화 측정 기법을 사용하여 정규화의 하한을 유도한다.

실험 결과

연구 질문

  • RQ1비용이 저렴하고 편향이 있는 근사치를 효과적으로 활용하여 고정밀도 실험에서 정규화를 줄일 수 있는 밴디트 알고리즘이 존재하는가?
  • RQ2누적 정규화를 최소화하기 위해 여러 정밀도 수준 간에 샘플링 노력이 어떻게 분배되어야 하는가?
  • RQ3다중 정밀도 밴디트 알고리즘의 이론적 정규화 하한은 무엇이며, 표준 UCB와 비교해 어떻게 되는가?
  • RQ4MF-UCB는 정규화 측면에서 거의 최적이며, 어떤 조건 하에서 이를 달성하는가?
  • RQ5실제로 낮은 정밀도 근사치의 사용이 고정밀도 쿼리 할당에 어떤 영향을 미치는가?

주요 결과

  • MF-UCB는 $\mathcal{O}\left((\lambda^{(1)}K + \lambda^{(2)}|\mathcal{K}_g|)\log(\Lambda / \lambda^{(2)})\right)$ 의 정규화 하한을 달성하며, $\lambda^{(1)} < \lambda^{(2)}$ 이고 $|\mathcal{K}_g| < K$ 일 때 표준 UCB보다 우수하다.
  • 알고리즘은 낮은 정밀도를 탐색 및 하위 최적 암 제거에 사용하고, 고정밀도 추출은 유망한 후보군의 소수에만 할애한다.
  • 경험적 결과는 MF-UCB가 가우시안 및 베르누이 수익을 가진 여러 합성 문제에서 표준 UCB를 일관되게 능가함을 보여준다.
  • MF-UCB의 정규화 기울기는 UCB보다 작아, 추출 횟수 증가에 따른 스케일링이 더 유리함을 시사한다.
  • 정규화에 대한 이론적 하한이 도출되었으며, 주어진 가정 하에서 MF-UCB가 거의 최적임을 보여준다.
  • 알고리즘의 성능은 정밀도 수준의 선택에 대해 강건하며, $\lambda^{(1)} \ll \lambda^{(2)}$ 일 경우 상당한 비용 절감 효과를 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.