[논문 리뷰] Recommendation System-based Upper Confidence Bound for Online Advertising
이 논문은 온라인 광고에서 제품 추천을 향상시키기 위해 사용자-사용자 협업 필터링을 상한 신뢰도(Upper Confidence Bound, UCB) 알고리즘에 통합한 하이브리드 강화학습 방법인 UCB-RS를 제안한다. 이는 역사를 기반으로 보상 신뢰도 범위를 추정함으로써, 대규모 비정적 행동 공간에서 UCB1과 EXP3S보다 20–40% 높은 클릭률을 달성한다. 이는 RecoGym 환경에서 평가되었다.
In this paper, the method UCB-RS, which resorts to recommendation system (RS) for enhancing the upper-confidence bound algorithm UCB, is presented. The proposed method is used for dealing with non-stationary and large-state spaces multi-armed bandit problems. The proposed method has been targeted to the problem of the product recommendation in the online advertising. Through extensive testing with RecoGym, an OpenAI Gym-based reinforcement learning environment for the product recommendation in online advertising, the proposed method outperforms the widespread reinforcement learning schemes such as $ε$-Greedy, Upper Confidence (UCB1) and Exponential Weights for Exploration and Exploitation (EXP3).
연구 동기 및 목표
- 온라인 광고 추천 시스템에서 비정적 사용자 행동과 막대한 행동 공간의 과제를 해결하기 위해.
- 강화학습 기법과 추천 시스템 기법을 융합하여 오프라인 추천 지표와 실제 온라인 성능 간 격차를 해소하기 위해.
- 협업 필터링을 활용하여 다중 권한 밴딧 설정에서의 탐색-이용 균형을 향상시키기 위해.
- 실제 광고 피드백을 시뮬레이션하는 현실적이고 확장 가능한 환경에서 제안된 방법을 평가하기 위해.
- ε-그리디, UCB1, EXP3과 같은 표준 강화학습 기반 알고리즘 대비 하이브리드 UCB-RS 접근법의 우수성을 입증하기 위해.
제안 방법
- 이 방법은 상한 신뢰도(Upper Confidence Bound, UCB) 알고리즘과 사용자-사용자 협업 필터링을 결합하여 제품에 대한 기대 보상을 추정한다.
- 기본적으로 이전 사용자 상호작용 세트를 사용하여 사용자 간 유사도를 계산하고, 대상 사용자에 대한 잠재적 보상을 유추한다.
- UCB-RS의 신뢰도 범위는 추정된 평균 보상과 불확실성 기반의 탐색 항목의 합으로 계산되며, 평균은 협업 필터링에서 유도된다.
- 비정적 사용자 행동에 적응하기 위해 최근 상호작용의 슬라이딩 윈도우를 사용해 보상 추정치를 동적으로 업데이트한다.
- 이 방법은 온라인 광고를 위한 시뮬레이터인 RecoGym(OpenAI Gym 기반)에서 구현되고 평가되었다. 이 환경은 전자상거래 및 광고 기반 사용자 상호작용을 통합한다.
- λ(협업 필터링에 대한 가중치)과 top-N(유사 사용자 수)과 같은 하이퍼파라미터는 성능 최적화를 위해 튜닝되었다.
실험 결과
연구 질문
- RQ1UCB에 협업 필터링을 통합함으로써 대규모 비정적 다중 권한 밴딧 문제에서 온라인 광고의 성능이 어떻게 향상되는가?
- RQ2유사 사용자 수(Top-N)와 가중 요소 λ가 UCB-RS 성능에 미치는 영향은 무엇인가?
- RQ3제품 인기도의 분산(σμ)이 UCB-RS의 성능에 미치는 영향은 기준 알고리즘 대비 어떻게 나타나는가?
- RQ4UCB-RS는 클릭률 측면에서 ε-그리디, UCB1, EXP3와 같은 표준 강화학습 알고리즘보다 얼마나 뛰어나게 성능을 발휘하는가?
- RQ5행동 공간 크기가 다양할 경우(예: 50, 100, 200개 제품) UCB-RS의 성능은 얼마나 견고한가?
주요 결과
- 모든 테스트 설정에서 UCB-RS III는 UCB1과 EXP3S 대비 20–40% 높은 클릭률을 기록한다.
- 제품 인기도 분산(σμ)이 클수록 UCB-RS의 성능이 향상되며, 이는 인기 있는 품목이 두드러지게 나타날수록 더 효과적임을 시사한다.
- 클릭률의 누적분포함수(CDF) 분석 결과, UCB-RS III를 사용할 경우 50% 이상의 사용자가 2% 이상의 CTR를 달성하며, 모든 기준 알고리즘을 초월한다.
- λ의 선택은 성능에 미치는 영향은 측정 가능하지만 크지 않으며, 최적의 값은 튜닝을 통해 도출되었다.
- 유사 사용자 수(Top-N)는 성능에 상당한 영향을 미치며, Top-N = 15일 경우에도 기준 알고리즘보다 뛰어난 성능을 기록한다.
- 200개의 제품이 있는 경우에도 UCB-RS III는 가장 높은 클릭률을 유지하여 대규모 행동 공간에 대한 확장성과 견고성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.