Skip to main content
QUICK REVIEW

[논문 리뷰] Importance weighting without importance weights: An efficient algorithm for combinatorial semi-bandits

Gergely Neu, Bartók Gábor|arXiv (Cornell University)|2015. 03. 17.
Advanced Bandit Algorithms Research참고 문헌 28인용 수 10
한 줄 요약

이 논문은 조합적 반-밴딧 문제에서 전통적인 중요도 가중치를 대체하는 계산적으로 효율적인 샘플 기반 방법인 기하적 재표본화(Geometric Resampling, GR)를 소개한다. GR를 Follow-the-Perturbed-Leader(FPL) 알고리즘과 결합함으로써, 반-밴딧 피드백 하에서 오프라인에서 온라인 조합 최적화로의 첫 번째 효율적인 감소를 달성하였으며, 이전의 비효율적 방법들과 동일한 확률적 최악의 경우 성능 보장을 갖는다.

ABSTRACT

We propose a sample-efficient alternative for importance weighting for situations where one only has sample access to the probability distribution that generates the observations. Our new method, called Geometric Resampling (GR), is described and analyzed in the context of online combinatorial optimization under semi-bandit feedback, where a learner sequentially selects its actions from a combinatorial decision set so as to minimize its cumulative loss. In particular, we show that the well-known Follow-the-Perturbed-Leader (FPL) prediction method coupled with Geometric Resampling yields the first computationally efficient reduction from offline to online optimization in this setting. We provide a thorough theoretical analysis for the resulting algorithm, showing that its performance is on par with previous, inefficient solutions. Our main contribution is showing that, despite the relatively large variance induced by the GR procedure, our performance guarantees hold with high probability rather than only in expectation. As a side result, we also improve the best known regret bounds for FPL in online combinatorial optimization with full feedback, closing the perceived performance gap between FPL and exponential weights in this setting.

연구 동기 및 목표

  • 오직 생성 분포의 표본 접근성만 있는 상황에서, 온라인 조합 최적화에서 중요도 가중치의 계산 비용이 지나치게 높아져 실행 불가능한 문제를 해결하기 위해.
  • 닫힌 형태의 표현식이 존재하지 않는, 예를 들어 블랙박스 생성 모델과 같은 환경에서 중요도 가중치를 추정하기 위한 실용적이고 표본 효율적인 방법을 개발하기 위해.
  • FPL 알고리즘을 사용하여 반-밴딧 피드백 하에서 오프라인에서 온라인 조합 최적화로의 첫 번째 계산적으로 효율적인 감소를 가능하게 하기 위해.
  • FPL 알고리즘이 조합적 반-밴딧 환경에서 높은 확률의 최악의 경우 성능 보장을 갖도록 하여, 기하 평균 가중치와의 성능 격차를 해소하기 위해.

제안 방법

  • 기본 분포에서의 i.i.d. 표본들만을 사용하여 중요도 가중치를 추정하는 새로운 재표본화 기법인 기하적 재표본화(Geometric Resampling, GR)를 제안한다.
  • GR를 Follow-the-Perturbed-Leader(FPL) 알고리즘에 적용하여, 명시적인 중요도 가중치를 재표본 추정치로 대체한다.
  • FPL에서 지수 분포의 페르터베이션을 사용하여 탐색을 유도하고, GR을 통해 암시적 표본 분포 하의 기대 손실을 일관되게 추정한다.
  • 지수 분포의 순서 통계량 이론을 기반으로, d개의 i.i.d. 지수 분포 랜덤 변수들 중 가장 큰 m개의 합의 기대값을 유계로 제한하는 분석을 수행한다.
  • 마팅게일 집중 부등식을 활용하여 높은 확률의 최악의 경우 성능 보장을 유도하며, 특히 마팅게일 차이에 대한 개선된 버전의 베르누이 타입 부등식을 적용한다.
  • 손실 벡터에 대한 선택 확률이 페르터베이션된 손실에 대해 단조 증가함을 보여주는 핵심 보조정리를 사용하여, 서로 다른 손실 구성 간의 비교를 가능하게 한다.

실험 결과

연구 질문

  • RQ1명시적 중요도 가중치 없이도 조합적 반-밴딧 환경에서 높은 확률의 최악의 경우 성능 보장을 달성할 수 있는가?
  • RQ2오직 생성 분포에 대한 표본 접근성만 있는 상황에서 중요도 가중치의 계산적으로 효율적인 대체 방법을 설계할 수 있는가?
  • RQ3새로운 재표본화 기법을 통해 FPL 알고리즘이 조합적 반-밴딧 환경에서 효율적이고 효과적으로 작동하도록 만들 수 있는가?
  • RQ4제안된 방법이 전체 피드백이 있는 온라인 조합 최적화에서 FPL과 기하 평균 가중치 간의 성능 격차를 해소하는가?
  • RQ5재표본화로 인한 분산을 제어하여 여전히 강력한 높은 확률의 최악의 경우 성능 보장을 달성할 수 있는가?

주요 결과

  • 제안된 기하적 재표본화(Geometric Resampling, GR) 방법은 반-밴딧 피드백 하에서 오프라인에서 온라인 조합 최적화로의 첫 번째 계산적으로 효율적인 감소를 가능하게 한다.
  • FPL+GR 알고리즘은 재표본화로 인한 높은 분산에도 불구하고, 이전의 비효율적 방법들과 동일한 높은 확률의 최악의 경우 성능 보장을 달성한다.
  • 이 방법은 전체 피드백이 있는 온라인 조합 최적화에서 FPL에 대한 첫 번째 높은 확률의 최악의 경우 성능 보장을 제공하며, 기하 평균 가중치와의 성능 격차를 해소한다.
  • 이론적 분석을 통해, d개의 i.i.d. 지수 분포 랜덤 변수들 중 가장 큰 m개의 순서 통계량의 기대합은 $ m( ext{log}(d/m) + 1) $ 이하로 유계임을 보였다.
  • FPL+GR의 최악의 경우 성능 보장은 $ O( ext{poly}(m) ext{polylog}(d) ext{polylog}(T)) $ 의 비율로 스케일링되며, 이는 이 설정에서 알려진 최적 비율과 일치한다.
  • 분석이 비음수 손실 벡터에 국한됨을 보여주는 레퍼런스 8의 의존성에 따라, 이 방법은 비음수 손실 벡터에 대해서만 유효하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.