[논문 리뷰] Hierarchical Contextual Uplift Bandits for Catalog Personalization
논문은 Hierarchical Contextual Uplift Bandit (HCUB) 프레임워크를 도입하여 코스-투-파인(context) 계층과 uplift 기반 보상을 사용해 Dream11 카탈로그를 개인화하고, 온라인 A/B 테스트에서 수익 상승을 달성하며 동적 환경에서의 적응력을 향상시킨다.
Contextual Bandit (CB) algorithms are widely adopted for personalized recommendations but often struggle in dynamic environments typical of fantasy sports, where rapid changes in user behavior and dramatic shifts in reward distributions due to external influences necessitate frequent retraining. To address these challenges, we propose a Hierarchical Contextual Uplift Bandit framework. Our framework dynamically adjusts contextual granularity from broad, system-wide insights to detailed, user-specific contexts, using contextual similarity to facilitate effective policy transfer and mitigate cold-start issues. Additionally, we integrate uplift modeling principles into our approach. Results from large-scale A/B testing on the Dream11 fantasy sports platform show that our method significantly enhances recommendation quality, achieving a 0.4% revenue improvement while also improving user satisfaction metrics compared to the current production system. We subsequently deployed this system to production as the default catalog personalization system in May 2025 and observed a further 0.5% revenue improvement.
연구 동기 및 목표
- 동적 판타지 스포츠 카탈로그에서 맥락 밴딧의 급격한 환경 변화와 콜드 스타트 문제를 해결한다.
- 시스템 수준 및 사용자 수준 맥락 간 정책 전이를 가능하게 하는 계층적 맥락 표현을 제시한다.
- 목표에 업 uplift 모델링을 포함시켜 수익, 참여, 유지 등 증분 비즈니스 영향 최적화한다.
- 생산 배포를 포함한 온라인 및 오프라인 성능을 평가하고 수익 및 참여에 미치는 영향을 정량화한다.
제안 방법
- 시스템 수준에서 사용자 수준 특징에 이르는 계층적 맥락 트리를 제안하여 맥락 표현을 수행한다.
- 단기 참여, 유지 프록시, 수익의 업 uplift 가중합으로 보상 함수를 정의한다.
- 보상 상속을 이용하여 계층 구조를 통해 업 uplift 신호를 위에서 아래로 전달하여 콜드스타트를 완화하고 탐사를 안정화한다.
- 계층적 부트스트래핑으로 업 uplift를 추정하여 각 노드-액션 쌍에 대한 중앙값과 신뢰 구간을 얻는다.
- 잎 노드에서 베이지안 UCB를 수행하여 카탈로그 액션을 선택하고 탐사와 활용의 균형을 맞춘다.
- 온라인 A/B 테스트와 오프라인 시뮬레이션으로 평가하되, 보상 상속을 제거하는 ablation을 포함한다.
실험 결과
연구 질문
- RQ1HCUB가 계층적 맥/context를 활용한 업(up lift) 보상으로 생산 카탈로그 개인화 시스템보다 매출과 참여를 개선하는가?
- RQ2계층적 보상 상 inheritance가 비정상적이고 동적인 환경에서 학습 속도와 적응에 미치는 영향은 무엇인가?
- RQ3대규모 온라인 배포와 오프라인 시뮬레이션에서 HCUB는 후회(레그레트)와 비즈니스 지표 면에서 어떻게 성능을 보이나?
- RQ4보상 상속이 사용자 코호트와 시스템 단위 맥락 전반의 학습을 안정시키고 콜드스타트를 완화하는가?
주요 결과
- 온라인 실험에서 HCUB에 의한 매출 상승 확인: 2025년 2월–3월(6M 사용자)에서 +0.42%(p=0.041), 2025년 5월–현재(Dream11 전체 베이스)에서 +0.51%(p=0.034).
- DAU 변화는 작고 통계적으로 유의하지 않음: +0.05%(2월–3월) 및 +0.1%(5월–현재).
- 오프라인 시뮬레이션에서 보상 상속 사용 시 상실(레그릿)이 4–5% 개선되는 것으로 나타남.
- 생산 배포에서 수익 개선을 달성하여 HCUB의 생산성 가능성을 확인함.
- 해당 접근법은 1) 단기 및 장기 참여 지표를 유지하거나 개선하면서 2) 상당한 수익 이득을 보여줌.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.