Skip to main content
QUICK REVIEW

[논문 리뷰] Multiarmed Bandit Problems with Delayed Feedback

Sudipto Guha, Kamesh Munagala|arXiv (Cornell University)|2010. 11. 04.
Advanced Bandit Algorithms Research참고 문헌 22인용 수 5
한 줄 요약

이 논문은 지연된 피드백이 있는 베이지안 다익음 밴딧 문제를 위한 다항식 시간 알고리즘을 제안하며, 구조적 정책 설계와 선형 프로그래밍 근사화를 활용하여 상수 요인 근사치를 달성한다. 일반적인 사전 분포의 광범위한 클래스에 대해 O(1)-근사치를 제공하고, 이전 연구에 비해 유한한 수평선 베이지안 밴딧 문제에 대해 2-근사치를 개선한다.

ABSTRACT

In this paper we initiate the study of optimization of bandit type problems in scenarios where the feedback of a play is not immediately known. This arises naturally in allocation problems which have been studied extensively in the literature, albeit in the absence of delays in the feedback. We study this problem in the Bayesian setting. In presence of delays, no solution with provable guarantees is known to exist with sub-exponential running time. We show that bandit problems with delayed feedback that arise in allocation settings can be forced to have significant structure, with a slight loss in optimality. This structure gives us the ability to reason about the relationship of single arm policies to the entangled optimum policy, and eventually leads to a O(1) approximation for a significantly general class of priors. The structural insights we develop are of key interest and carry over to the setting where the feedback of an action is available instantaneously, and we improve all previous results in this setting as well.

연구 동기 및 목표

  • 온라인 광고 및 스토하스틱 제어에서 흔한 지연된 피드백이 있는 다익음 밴딧 문제에서 증명 가능한 보장을 제공하지 못하는 문제를 해결한다.
  • 보상 피드백이 δi 단계 지연되는 다익음 밴딧 문제에 대해 계산 효율적인 정책을 개발하며, 각 암의 보상에 예산 제약 조건을 충족시킨다.
  • 일반적인 사전 분포의 광범위한 클래스에 대해 상수 요인 근사치(O(1))를 제공하여, 이전 연구에서 이러한 보장을 갖지 못했던 분야를 확장한다.
  • 유한한 수평선 베이지안 밴딧 문제에 대해 2-근사치를 제안하여 이전 연구를 개선하고 일반화한다.
  • 지연된 피드백과 겹치는 플레이 스케줄에도 불구하고 타당성과 근사 최적 성능을 보장하는 우선순위 기반 정책 조합 메커니즘을 설계한다.

제안 방법

  • 지연된 피드백이 있는 밴딧 문제를 블록 기반 상태 표현을 사용하여 모델링하며, 플레이 후 피드백은 δi 단계 후에 도착한다.
  • 상태 전이, 플레이 횟수, 기대 보상을 모두 포함하는 선형 프로그래밍(LP2)을 사용해 각 암에 대해 무작위로 설계된 잘 정의된 정책을 정의한다.
  • 모든 암의 총 플레이 수가 수평선 T를 초과하지 않도록 하기 위해 LP 해를 γ 요인으로 스케일링하여 수정된 LP(LP2s)를 도출한다.
  • LP 해를 기반으로, 상태와 플레이 횟수에 따라 블록당 연속 플레이 횟수를 확률적으로 선택하는 단일 암 정책 P^r(i,T/2)를 구성한다.
  • 개별 암 정책을 우선순위 기반 방식으로 조합한다: 암은 고정된 순서로 선택되며, 피드백을 기다리는 암은 플레이 대상에서 제외된다.
  • 마르코프 부등식을 사용해 간섭을 상한선으로 제한하고, 각 암의 정책이 상수 확률로 실행됨을 보여, 기대 보상을 유지한다.

실험 결과

연구 질문

  • RQ1일반적인 사전 분포 하에서 지연된 피드백이 있는 다익음 밴딧 문제에 대해 증명 가능한 좋은 정책을 설계할 수 있는가?
  • RQ2지연된 피드백과 예산 제약 조건이 있는 다익음 밴딧 문제에 대해 다항식 시간 내에서 달성 가능한 최고의 근사 비율은 무엇인가?
  • RQ3지연된 피드백을 어떻게 모델링하고 관리할 수 있는가? 이는 베이지안 밴딧 설정에서 성능 보장을 유지하는 데 기여하는가?
  • RQ4지연된 피드백 문제에서의 구조적 통찰을 활용해 순시 피드백 설정에서의 성능을 향상시킬 수 있는가?
  • RQ5피드백 지연은 무작위로 잘 정의된 정책의 타당성과 성능에 어떤 영향을 미치는가?

주요 결과

  • 이 논문은 지연된 피드백이 있는 다익음 밴딧 문제에 대해 일반적인 사전 분포의 광범위한 클래스에 대해 O(1)-근사치를 달성하며, 지수적 시간보다 빠른 실행 시간을 갖는 첫 번째 보장을 제공한다.
  • 유한한 수평선 베이지안 밴딧 문제에 대해 2-근사치가 확립되었으며, 이는 이전 연구를 개선하고 일반화한 것이다.
  • 우선순위 기반 실행 체계 덕분에 복합 정책 하에서 각 암의 기대 기여도는 개별 무작위 정책 하에서의 기대 보상의 최소 1/8 이상이다.
  • LP 근사화(LP2s)는 총 플레이 수가 T 이내로 제한됨을 보장하며, 기대 보상은 Ω(OPT)이므로 최적 정책에 대해 상수 요인 이내의 해를 제공한다.
  • 지연된 피드백 문제에서의 구조적 통찰은 순시 피드백 설정에서의 성능 향상에 기여하며, 이 프레임워크의 광범위한 적용 가능성을 보여준다.
  • 우선순위 기반 정책 조합은 암 간의 간섭을 상한선으로 제한하여, 겹치는 피드백 지연에도 불구하고 각 암의 정책이 상수 확률로 실행됨을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.