Skip to main content
QUICK REVIEW

[논문 리뷰] Contextual Bandit with Missing Rewards

Djallel Bouneffouf, Sohini Upadhyay|arXiv (Cornell University)|2020. 07. 13.
Advanced Bandit Algorithms Research참고 문헌 38인용 수 5
한 줄 요약

이 논문은 누락된 보상값을 보간하기 위해 온라인 클러스터링을 통합한 컨텍스트 밴딧 알고리즘인 MLINUCB를 제안한다. 이는 보상값이 관측되지 않더라도 컨텍스트로부터 학습할 수 있도록 한다. 컨텍스트 벡터가 클러스터링된 매니폴드 위에 존재한다고 모델링함으로써, 표준 LINUCB에 비해 정확도를 향상시키며, 특히 보상값 누락 비율이 높은 상황에서 성능 향상이 두드러진다. 실세계 데이터셋인 Internet Advertisements와 Warfarin에서 정확도 향상 폭이 최대 10.9%에 이르렀다.

ABSTRACT

We consider a novel variant of the contextual bandit problem (i.e., the multi-armed bandit with side-information, or context, available to a decision-maker) where the reward associated with each context-based decision may not always be observed("missing rewards"). This new problem is motivated by certain online settings including clinical trial and ad recommendation applications. In order to address the missing rewards setting, we propose to combine the standard contextual bandit approach with an unsupervised learning mechanism such as clustering. Unlike standard contextual bandit methods, by leveraging clustering to estimate missing reward, we are able to learn from each incoming event, even those with missing rewards. Promising empirical results are obtained on several real-life datasets.

연구 동기 및 목표

  • 임상 시험과 광고 추천 시스템 등에서 흔히 발생하는 보상값 누락 문제를 해결하기 위해.
  • 보상 피드백이 부분적 또는 완전히 관측되지 않더라도 컨텍스트 데이터로부터 효과적으로 학습할 수 있도록 하기 위해.
  • 컨텍스트 벡터의 구조적 패턴을 활용하여 표준 컨텍스트 밴딧 방법(예: LINUCB)을 개선하기 위해.
  • 컨텍스트 공간이 클러스터링된 매니폴드 구조를 띠고 있을 경우, 클러스터링 기반 보상 보간이 성능 향상에 기여하는지 검증하기 위해.
  • 클러스터 수와 탐색 비율 등의 하이퍼파rameter가 알고리즘 성능에 미치는 영향을 탐색하기 위해.

제안 방법

  • 이전 유사한 컨텍스트를 활용해 누락된 보상을 추정하기 위해 LINUCB 컨텍스트 밴딧 알고리즘과 온라인 클러스터링을 통합한다.
  • k-means 클러스터링을 사용해 컨텍스트 벡터를 그룹화하고, 각 컨텍스트를 클러스터에 할당하여 보상 보간을 수행한다.
  • 유사한 컨텍스트는 유사한 보상을 유발한다고 가정하여, 동일 클러스터의 평균 관측 보상값을 사용해 누락된 보상을 보간한다.
  • 각 클러스터 내에서 선형 모델을 적용해 기대 보상을 예측함으로써, LINUCB 프레임워크의 리그레트 한계를 유지한다.
  • 클러스터 수 $N$을 하이퍼파rameter로 간주하며, 온라인 최적화나 적응형 선택 가능성도 고려한다.
  • 가중 평균을 사용해 클러스터 보상을 보간하며, 다중 최근접 클러스터($m > 1$)로의 확장도 가능하다.

실험 결과

연구 질문

  • RQ1보상값이 누락되었을 때, 클러스터링 기반 보상 보간이 컨텍스트 밴딧 성능 향상에 기여하는가?
  • RQ2클러스터링된 컨텍스트 벡터의 매니폴드 가정이 성능 향상에 기여하는 조건은 무엇인가?
  • RQ3클러스터 수 $N$이 표준 LINUCB에 비해 제안된 방법의 정확도와 리그레트에 미치는 영향은 어떠한가?
  • RQ4높은 비율의 보상 누락 상황에서도 제안된 방법이 낮은 리그레트를 유지하는가?
  • RQ5알고리즘이 온라인 학습 중에 최적의 클러스터 수 $N$을 적응적으로 선택할 수 있는가?

주요 결과

  • Internet Advertisements 데이터셋에서, 25%의 보상이 누락되었을 때 MLINUCB는 정확도를 LINUCB의 86.6%에서 90.2%로 향상시켰다.
  • 50%의 보상이 누락되었을 때 동일한 데이터셋에서 정확도는 82.4%에서 90.3%로 상승했으며, 높은 누락 비율에 대한 강건성을 보였다.
  • 75%의 보상이 누락되었을 때 정확도는 78.6%에서 89.6%로 상승했으며, 극단적인 누락 상황에서도 일관된 성능 향상을 보였다.
  • Warfarin 데이터셋에서는 2차원 주성분 분석(PCA)이 분산의 98.2%를 설명했고, MLINUCB는 모든 테스트된 클러스터 수에서 LINUCB를 능가했다.
  • CNAE-9 데이터셋에서는 2차원 투영에서 분산이 13.9%에 불과했음에도 불구하고, MLINUCB는 다양한 탐색 비율 $\alpha$에서 LINUCB를 항상 능가했다.
  • 2차원 PCA에서 분산이 29.7%에 그친 Covertype 데이터셋은 MLINUCB에서 성능 향상이 없었으며, 이는 매니폴드 가정 위반을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.