[논문 리뷰] Thompson Sampling for a Fatigue-aware Online Recommendation System
이 논문은 조합 밴딧 환경에서 피로도를 고려한 온라인 추천에 대해 톰슨 샘플링 기반 알고리즘인 순차적 밴딧 온라인 추천 시스템(SBORS)을 제안한다. 사용자 피로도와 위치 효과를 파라미터 기반 확률적 피드백으로 모델링함으로써, 항목 수에 대해 다항 회귀(regret)를 달성한다. 구체적으로, $ C_1N^2\sqrt{NT\log TR} + C_2N\sqrt{T\log TR \cdot \log T} + C_3N/R $이며, 5배 이하로 낮은 회귀를 보이는 시뮬레이션에서 UCB 기반 기준선보다 뛰어난 성능을 보인다.
In this paper we consider an online recommendation setting, where a platform recommends a sequence of items to its users at every time period. The users respond by selecting one of the items recommended or abandon the platform due to fatigue from seeing less useful items. Assuming a parametric stochastic model of user behavior, which captures positional effects of these items as well as the abandoning behavior of users, the platform's goal is to recommend sequences of items that are competitive to the single best sequence of items in hindsight, without knowing the true user model a priori. Naively applying a stochastic bandit algorithm in this setting leads to an exponential dependence on the number of items. We propose a new Thompson sampling based algorithm with expected regret that is polynomial in the number of items in this combinatorial setting, and performs extremely well in practice.
연구 동기 및 목표
- 반복적으로 낮은 가치의 항목이 노출될 경우 사용자가 기각하는 현상으로 인해 발생하는 사용자 피로도 문제를 해결하기 위해.
- 장기적 유틸리티를 최대화하면서 회귀를 최소화하는 순서 있는 항목 시퀀스를 선택하는 조합 밴딧 알고리즘을 설계하기 위해.
- 항목의 품질, 위치 효과, 기각 보상 패널티를 포함한 파라미터 기반 확률적 과정으로 사용자 행동을 모델링하기 위해.
- 항목 수에 대해 다항적으로 증가하는 증명 가능 회귀 한계를 가진 톰슨 샘플링 기반 알고리즘을 개발하여, 난이도가 높은 MAB 접근 방식에서 관찰되는 지수적 의존성을 피하기 위해.
제안 방법
- 사용자 선호도와 기각 확률 파rameter의 불확실성을 모델링하기 위해, 정규 분포를 사용한 후행 분포 근사치를 사용한 톰슨 샘플링을 적용한다.
- 항목 간의 상관 샘플링을 통해 탐색의 일관성을 유지하고 항목 유틸리티 및 피로 효과의 의존성을 활용한다.
- 조정 가능한 파rameter $ R $를 통해 분산 강화(variance boosting)를 적용하여 초기 라운드에서 탐색을 향상시키고 수렴을 개선한다.
- 베이지안 업데이트를 사용하여 항목 유틸리티 $ u_i $, 기각 확률 $ p_i $ 및 보상 분포에 대한 믿음 분포를 동적으로 업데이트한다.
- 탐색과 이용의 균형을 맞추기 위해 기대 유틸리티 $ \mathbb{E}[U(\mathbf{S}; \mathbf{u}_{t-1}^{UCB}, q_{t-1}^{UCB})] $를 최대화하는 시퀀스 $ \mathbf{S}^t $를 선택하는 추천 정책을 적용한다.
- SBORS 실행 전 후행 추정치를 초기화하기 위해 UCB 유사 전구 알고리즘(알고리즘 1)을 사용한다.
실험 결과
연구 질문
- RQ1피로도와 알려지지 않은 선호 모델이 존재하는 조합 온라인 추천 환경에서, 톰슨 샘플링 기반 알고리즘이 항목 수에 대해 다항적 회귀를 달성할 수 있는가?
- RQ2SBORS의 탐색-이용 균형 전략이 UCB 기반 접근 방식과 비교해 회귀 및 수렴 속도 측면에서 어떻게 다른가?
- RQ3핵심 알고리즘 파ram터인 $ R $, $ \alpha $, $ \beta $가 실질적으로 회귀와 수렴에 미치는 영향은 무엇인가?
- RQ4제안된 후행 근사 및 상관 샘플링 전략은 피로도를 고려한 환경에서 표준 밴딧 알고리즘보다 성능 향상을 이끌어내는가?
주요 결과
- SBORS는 항목 수 $ N $에 대해 다항적으로 증가하는 회귀 상한선 $ C_1N^2\sqrt{NT\log TR} + C_2N\sqrt{T\log TR \cdot \log T} + C_3N/R $을 달성하여, 난이도가 높은 MAB 접근 방식에서 관찰되는 지수적 의존성을 피한다.
- 모의 실험에서 $ N=30 $일 경우, $ \mathbf{u} \sim [0,0.1] $에 대해 270.1에서 $ \mathbf{u} \sim [0,0.5] $에 대해 91.2로 회귀가 감소하여, 사용자 선호도가 더 분산되어 있을 경우 더 빠른 수렴과 낮은 회귀를 보였다.
- 샘플링 파ram터 $ R $의 값이 낮을수록 회귀가 감소했으며, $ R=1 $일 때도 잘 작동하여 분산 강화가 탐색 효율성을 향상시킨다는 것을 시사한다.
- $ \alpha $ 및 $ \beta $의 값이 낮을수록 회귀가 감소했으며, 이론적 하한선인 $ \beta \geq 2 $보다 $ \beta < 2 $일 때 더 나은 경험적 성능을 보여 분석에 여유가 있음을 시사한다.
- SBORS의 전구 알고리즘인 알고리즘 1은 Cao와 Sun(2019)의 UCB 기반 알고리즘보다 상당히 낮은 회귀를 달성했으며, 다수의 런에서 누적 회귀가 최소 5배 이상 감소했다.
- SBORS는 $ \mathbf{u} $, $ R $, $ \alpha $, $ \beta $의 다양한 설정에서 뛰어난 성능을 유지했으며, 다양한 파ram터 설정에서 기준선 대비 일관된 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.