Skip to main content
QUICK REVIEW

[논문 리뷰] Contextual Multi-armed Bandit Algorithm for Semiparametric Reward Model

Gi-Soo Kim, Myunghee Cho Paik|arXiv (Cornell University)|2019. 01. 31.
Advanced Bandit Algorithms Research인용 수 6
한 줄 요약

이 논문은 시간에 따라 변화하는 기저 보상이 있는 반모수적 보상 모델을 위한 새로운 문맥적 다중 손잡이 슬롯머신 알고리즘을 제안한다. 이 알고리즘은 강력한 파라미터적 가정을 필요로 하지 않으며, 가중치를 적용한 문맥 중심화와 새로운 마팅게일 부등식을 사용하여 선형 모델 하에서 톰슨 샘플링과 동일한 순서의 리그레트 한계를 달성한다. 이는 이전의 동일한 비정상 모델에 비해 계산적으로 효율적이고 더 쉽게 구현 가능하다.

ABSTRACT

Contextual multi-armed bandit (MAB) algorithms have been shown promising for maximizing cumulative rewards in sequential decision tasks such as news article recommendation systems, web page ad placement algorithms, and mobile health. However, most of the proposed contextual MAB algorithms assume linear relationships between the reward and the context of the action. This paper proposes a new contextual MAB algorithm for a relaxed, semiparametric reward model that supports nonstationarity. The proposed method is less restrictive, easier to implement and faster than two alternative algorithms that consider the same model, while achieving a tight regret upper bound. We prove that the high-probability upper bound of the regret incurred by the proposed algorithm has the same order as the Thompson sampling algorithm for linear reward models. The proposed and existing algorithms are evaluated via simulation and also applied to Yahoo! news article recommendation log data.

연구 동기 및 목표

  • 문맥과 보상 간의 시간에 따라 변하지 않는 선형 관계를 가정하는 기존의 문맥적 MAB 알고리즘의 한계를 해결하기 위해.
  • 시간에 따라 변화하는 절편 항을 포함한 반모수적 모델을 통해 비정상적인 보상 메커니즘을 지원하는 방법을 개발하기 위해.
  • 동일한 비정상 모델 하에서 기존 알고리즘에 비해 계산 효율성과 구현의 간편성을 향상시키기 위해.
  • 선형 모델 하에서 톰슨 샘플링과 동일한 순서의 고확률 리그레트 상한을 확립하기 위해.
  • 조정 파rameter가 없는 일관된 추정기법을 제공하여 기존 추정기보다 더 빠른 수렴 속도를 달성하기 위해.

제안 방법

  • 반모수적 모델에서 회귀 계수를 일관되게 추정하기 위해 문맥 벡터의 가중치 중심화를 사용한다.
  • 새로운 마팅게일 부등식을 적용하여 제안된 알고리즘의 고확률 리그레트 상한을 유도한다.
  • 모든 수의 액션에 대해 명시적으로 정의된 분포를 갖는 톰슨 샘플링 유사 행동 선택 전략을 채택한다.
  • 각 반복에서 O(N) 연산만을 요구하는 계산적으로 효율적인 알고리즘을 도입하여 액션 제거 방법의 O(N²) 비용을 피한다.
  • 관찰 데이터 로그에서 누적 보상을 추정하기 위해 Li 등(2011)의 오프라인 평가 방법을 활용한다.
  • Yahoo! R6A 데이터셋의 검증 데이터를 기반으로 조정 파ram터 선택 절차를 적용한다.

실험 결과

연구 질문

  • RQ1비정상적인 보상이 있는 반모수적 모델을 위한 문맥적 MAB 알고리즘을 개발할 수 있는가? 이 알고리즘은 계산적으로 효율적이고 쉽게 구현 가능한가?
  • RQ2모델의 파라미터적 가정을 완화함에도 불구하고, 선형 모델 하에서 톰슨 샘플링과 동일한 순서의 리그레트 한계를 달성하는가?
  • RQ3비정상적인 보상 조건 하에서, 제안된 알고리즘이 기존 알고리즘에 비해 누적 보상과 학습 속도 측면에서 어떻게 비교되는가?
  • RQ4추정기의 조정 파ram터가 추가로 필요 없이도 기존 추정기보다 더 빠른 수렴 속도를 달성할 수 있는가?
  • RQ5실제 응용, 예를 들어 관찰 로그 데이터를 활용한 뉴스 기사 추천에서, 제안된 방법이 기존 알고리즘을 초월하는가?

주요 결과

  • 제안된 알고리즘은 더 일반적인 반모수적 모델을 사용함에도 불구하고, 선형 모델 하에서 톰슨 샘플링과 동일한 순서의 고확률 리그레트 상한을 달성한다.
  • 시뮬레이션 연구에서, 특히 기저 보상이 시간에 따라 변화할 경우, 제안된 방법은 비정상적인 보상 조건 하에서 기존 방법보다 항상 낮은 누적 리그레트를 기록했다.
  • Yahoo! R6A 데이터셋에서, 제안된 알고리즘은 10회의 실행 평균 클릭률 90,689.7을 기록하여 원래의 톰슨 샘플링 알고리즘 대비 4.4% 향상된 성능을 보였다.
  • 제안된 방법은 ACTS 알고리즘보다 더 빠른 학습 속도를 보였고, N > 2에 대해 명시적인 행동 선택 방법이 없는 BOSE와도 경쟁 가능했다.
  • 제안된 회귀 계수 추정기법은 기존 추정기보다 더 빠른 수렴 속도를 보였고, 추가 조정 파ram터가 필요 없었다.
  • 다양한 액션 수(N=2 및 N=6)에서 제안된 방법은 시간에 따라 변화하는 절편 하에서도 강력한 리그레트 성능을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.