Skip to main content
QUICK REVIEW

[논문 리뷰] Contextual User Browsing Bandits for Large-Scale Online Mobile Recommendation

Xu He, Bo An|arXiv (Cornell University)|2020. 08. 21.
Advanced Bandit Algorithms Research참고 문헌 23인용 수 7
한 줄 요약

이 논문은 사용자 브라우징 모델(UBM)을 통합하여 항목 검토 확률을 추정함으로써 위치 편향과 의사 노출을 모델링하는 컨텍스트ual 조합 bandit 알고리즘인 UBM-LinUCB를 제안한다. 이 알고리즘은 선형 회귀가 아닌 하한을 가지며, 타오바오에서 실시한 오프라인 및 온라인 실험에서 기준 알고리즘을 능가하여 클릭률(CTR) 지표를 크게 향상시킨다.

ABSTRACT

Online recommendation services recommend multiple commodities to users. Nowadays, a considerable proportion of users visit e-commerce platforms by mobile devices. Due to the limited screen size of mobile devices, positions of items have a significant influence on clicks: 1) Higher positions lead to more clicks for one commodity. 2) The 'pseudo-exposure' issue: Only a few recommended items are shown at first glance and users need to slide the screen to browse other items. Therefore, some recommended items ranked behind are not viewed by users and it is not proper to treat this kind of items as negative samples. While many works model the online recommendation as contextual bandit problems, they rarely take the influence of positions into consideration and thus the estimation of the reward function may be biased. In this paper, we aim at addressing these two issues to improve the performance of online mobile recommendation. Our contributions are four-fold. First, since we concern the reward of a set of recommended items, we model the online recommendation as a contextual combinatorial bandit problem and define the reward of a recommended set. Second, we propose a novel contextual combinatorial bandit method called UBM-LinUCB to address two issues related to positions by adopting the User Browsing Model (UBM), a click model for web search. Third, we provide a formal regret analysis and prove that our algorithm achieves sublinear regret independent of the number of items. Finally, we evaluate our algorithm on two real-world datasets by a novel unbiased estimator. An online experiment is also implemented in Taobao, one of the most popular e-commerce platforms in the world. Results on two CTR metrics show that our algorithm outperforms the other contextual bandit algorithms.

연구 동기 및 목표

  • 제한된 화면 공간으로 인해 일반적으로 상단 순위의 항목들만 뷰어블이 되는 모바일 온라인 추천 환경에서의 위치 편향과 의사 노출 문제를 해결하기 위해.
  • 개별 항목이 아닌 추천 항목의 집합에 대한 보상을 모델링하여 실제 모바일 추천 환경을 반영하기 위해.
  • 사용자 브라우징 행동과 위치 기반 검토 확률을 고려한 컨텍스트ual 조합 bandit 알고리즘을 개발하기 위해.
  • 항목 수에 관계없이 선형 회귀가 보장되는 공식적인 회귀 분석을 제공하기 위해.
  • 타오바오에서 대규모 온라인 A/B 테스트를 통해 방법을 실증적으로 평가하기 위해.

제안 방법

  • 세트 기반 보상 함수를 가진 컨텍스트ual 조합 bandit 문제로 온라인 모바일 추천을 수식화한다.
  • 항목의 위치와 그 위의 마지막 클릭을 바탕으로 검토 확률을 추정하기 위해 사용자 브라우징 모델(UBM)을 도입한다.
  • UBM로 추정한 검토 확률을 선형 보상 모델에 통합하여 보다 나은 정책 학습을 위한 bandit 알고리즘인 UBM-LinUCB를 제안한다.
  • UBM에서 유도된 가중치를 사용하여 탐색과 이용의 균형을 이루는 선형 상한 신뢰도(LinUCB) 프레임워크를 사용한다.
  • 선택 편향을 보정하기 위해 오프라인 평가에서 비편향 추정기를 사용한다.
  • 실제 타오바오 A/B 테스트에서 알고리즘을 구현하였으며, 사용자는 서로 다른 알고리즘을 가진 버킷으로 무작위로 할당되고, 온라인 로그를 사용하여 파rameter를 업데이트한다.

실험 결과

연구 질문

  • RQ1모바일 전자상거래 환경에서 위치 기반 사용자 행동을 고려할 때, 추천 항목 세트의 보상을 어떻게 모델링할 수 있는가?
  • RQ2UBM를 통해 사용자 브라우징 행동을 모델링하는 것은 표준 bandit 방법에 비해 온라인 추천 성능을 얼마나 향상시키는가?
  • RQ3위치 편향과 의사 노출을 고려하면서도 선형 회귀를 달성할 수 있는 컨텍스트ual 조합 bandit 알고리즘이 존재하는가?
  • RQ4UBM-LinUCB는 오프라인 및 온라인 환경에서 기존 bandit 알고리즘과 비교하여 어떻게 성능을 발휘하는가?
  • RQ5더 정확한 사용자 브라우징 모델을 사용할 경우 CTR와 전체 추천 효과성에 어떤 영향을 미치는가?

주요 결과

  • UBM-LinUCB는 총 항목 수에 관계없이 Õ(d√(TK))로 제한된 선형 기대 누적 회귀를 달성한다.
  • 오프라인 실험에서 UBM-LinUCB는 C2UCB 및 DCM-LinUCB와 같은 기준 알고리즘보다 CTR_sum 및 CTR_set 지표에서 모두 뛰어난 성능을 보였다.
  • 타오바오에서 실시한 온라인 A/B 테스트 결과, UBM-LinUCB는 3일 동안 일관되게 가장 높은 CTR를 기록하였으며, 기준 대비 안정적이고 유의미한 향상을 보였다.
  • 알고리즘은 시간이 지남에 따라 CTR_sum 및 CTR_set 지표를 지속적으로 향상시켰으며, 약 6000만 개의 항목을 포함한 고용량 실세계 환경에서도 강건함을 입증했다.
  • 추천 항목 수(K)가 증가할수록 성능 향상이 두드러지게 나타나, UBM-LinUCB가 대규모 환경에서의 확장성과 효과성을 잘 보여주었다.
  • 결과는 UBM를 통한 사용자 브라우징 행동 모델링이 위치 효과를 忽시하거나 단순화된 클릭 모델을 사용하는 방법보다 더 정확한 보상 추정과 더 나은 정책 학습을 가능하게 한다는 것을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.