[논문 리뷰] Beyond the Click-Through Rate: Web Link Selection with Multi-level Feedback
이 논문은 웹 링크 선택을 위한 제약이 있는 상한 신뢰 구간(Con-UCB) 알고리즘을 제안하며, 다수준 피드백 구조 하에서 클릭률(유혹력)과 클릭 후 수익(수익성)을 동시에 최적화한다. 스토하스틱이고 컨텍스트 없는 환경에서 하위선형의 오차 및 위반 경계를 달성하며, 실제 데이터셋에서 최신 밴딧 알고리즘들을 능가하여 보상과 제약 이행을 균형 있게 조절한다.
The web link selection problem is to select a small subset of web links from a large web link pool, and to place the selected links on a web page that can only accommodate a limited number of links, e.g., advertisements, recommendations, or news feeds. Despite the long concerned click-through rate which reflects the attractiveness of the link itself, the revenue can only be obtained from user actions after clicks, e.g., purchasing after being directed to the product pages by recommendation links. Thus, the web links have an intrinsic \emph{multi-level feedback structure}. With this observation, we consider the context-free web link selection problem, where the objective is to maximize revenue while ensuring that the attractiveness is no less than a preset threshold. The key challenge of the problem is that each link's multi-level feedbacks are stochastic, and unobservable unless the link is selected. We model this problem with a constrained stochastic multi-armed bandit formulation, and design an efficient link selection algorithm, called Constrained Upper Confidence Bound algorithm ( extbf{Con-UCB}), and prove $O(\sqrt{T\ln T})$ bounds on both the regret and the violation of the attractiveness constraint. We conduct extensive experiments on three real-world datasets, and show that extbf{Con-UCB} outperforms state-of-the-art context-free bandit algorithms concerning the multi-level feedback structure.
연구 동기 및 목표
- 클릭률(CTR)과 클릭 후 수익이라는 다수준 피드백을 생성하는 웹 링크 선택 문제를 해결하기 위해.
- 최소 유혹력(CTR)을 하드 제약으로 유지하면서 총 복합 수익을 최대화하기 위해.
- 링크가 선택되지 않는 한 관측 불가능한 스토하스틱 다수준 피드백의 과제를 다루기 위해.
- 사용자 또는 콘텐츠 컨텍스트 없이 작동하는 컨텍스트 없는 밴딧 알고리즘을 설계하여, 익명 모드, 쿠키 차단 또는 냉각기 시나리오에 적합하게 하기 위해.
- 높은 확률 보장 하에 하위선형 오차 및 제약 위반 경계를 달성하기 위해.
제안 방법
- 첫 번째 수준(CTR)과 두 번째 수준(클릭 후 수익)의 두 수준의 보상을 가진 제약이 있는 스토하스틱 다중 플레이 다원단추 밴딧(MAB) 문제로 문제를 수립한다.
- 복합 보상은 CTR와 클릭 후 수익의 곱으로 정의되며, 링크당 총 기대 수익을 나타낸다.
- 탐색과 이용의 균형을 유지하면서 유혹력 제약을 준수하기 위해 상한 신뢰 구간(UCB)을 사용하여 Con-UCB 알고리즘을 설계한다.
- 누적 유혹력이 기준 이하로 떨어지지 않도록 하기 위해 라그랑주 완화 방법을 통합하여 제약 위반에 동적으로 대응한다.
- 고확률 농도 경계를 사용하여 오차와 제약 위반이 확률 $1 - \delta$ 이상에서 $O(\sqrt{T\ln(T/\delta)})$ 의 속도로 증가함을 증명한다.
- 매 라운드에 $K$개의 링크 중에서 $L$개의 링크를 순차적으로 선택하는 순차적 의사결정 설정에 알고리즘을 적용한다.
실험 결과
연구 질문
- RQ1관측 불가능한 다수준 피드백 하에서, 밴딧 알고리즘이 웹 링크 선택 시 수익 극대화와 유혹력 제약을 효과적으로 균형 있게 조절할 수 있는가?
- RQ2피드백이 스토하스틱이며 선택 시에만 공개되지만, 컨텍스트 없는 밴딧 알고리즘이 하위선형 오차 및 제약 위반을 달성할 수 있는가?
- RQ3제약 인식 탐색을 갖춘 UCB 기반 최적화가 지수 가중 기반 알고리즘(LExp)에 비해 보상과 제약 위반의 균형을 더 잘 이룹니까?
- RQ4다수준 피드백 환경에서 제약이 있는 MAB 알고리즘의 이론적 성능 보장(오차 및 위반 경계)은 무엇인가요?
- RQ5실제 데이터셋에서 다수준 피드백을 가진 실세계 데이터 기반으로 Con-UCB는 최신 컨텍스트 없는 밴딧 알고리즘들과 비교해 어떻게 성능을 냅니까?
주요 결과
- Coupon-Purchase 데이터셋에서 Con-UCB는 LExp보다 유의미하게 낮은 누적 오차를 기록하여 탐색-이용 균형 조절이 뛰어나다는 것을 입증한다.
- 모든 알고리즘 중에서 Con-UCB가 가장 낮은 누적 제약 위반을 기록하며, CUCB나 Exp3.M과 같은 제약가 없는 기반 알고리즘들이 유혹력 기준을 크게 위반하는 것과 대비된다.
- 모든 데이터셋에서 Con-UCB는 보상 대 위반 비율이 가장 높아, 수익과 제약 준수 간의 가장 효율적인 균형을 이룬다.
- Ad-Clicks 및 edX-Course 데이터셋에서 Con-UCB는 LExp보다 낮은 오차와 더 높은 누적 수익을 기록하면서도 가장 낮은 위반 수준을 유지한다.
- 오차 및 제약 위반에 대해 $O(\sqrt{T\ln(T/\delta)})$ 의 이론적 경계가 세 개의 실세계 데이터셋 전반에서 경험적으로 검증되었다.
- 경험 결과는 Con-UCB가 오차와 위반 양면에서 LExp를 능가하며, 이론적 보장과 일치하며 다수준 피드백 환경에서 뛰어난 강건성을 보임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.