[논문 리뷰] Online Clustering of Contextual Cascading Bandits
이 논문은 사용자 선호도가 알려지지 않은 군집으로 묶이고 사용자 클릭 행동에서 유도된 프리픽스 피드백을 통해 학습되는 온라인 컨텍스트 캐스케이딩 밴딧을 위한 CLUB-cascade 알고리즘을 제안한다. 일반적인 경우에서 $ ilde{O}( extstyle oot{2}{T})$의 리그레트 바운드를 달성하며, 특수한 한 군집 설정에서 이전 작업을 개선하여 MovieLens 및 Yelp와 같은 합성 및 실세계 데이터셋에서 뛰어난 성능을 보였다.
We consider a new setting of online clustering of contextual cascading bandits, an online learning problem where the underlying cluster structure over users is unknown and needs to be learned from a random prefix feedback. More precisely, a learning agent recommends an ordered list of items to a user, who checks the list and stops at the first satisfactory item, if any. We propose an algorithm of CLUB-cascade for this setting and prove a $T$-step regret bound of order $ ilde{O}(\sqrt{T})$. Previous work corresponds to the degenerate case of only one cluster, and our general regret bound in this special case also significantly improves theirs. We conduct experiments on both synthetic and real data, and demonstrate the effectiveness of our algorithm and the advantage of incorporating online clustering method.
연구 동기 및 목표
- 사용자 클릭 행동에서 유도된 프리픽스 피드백을 통해 알려지지 않은 사용자 군집 구조를 학습하는 데 도전하는 것.
- 사전에 군집 지식 없이도 사용자 유사성을 적응적으로 학습하고 공동 필터링을 활용하는 알고리즘을 설계하는 것.
- 단일 군집 또는 고정된 사용자 그룹화를 가정하는 기존 선형 밴딧 방법보다 누적 리그레트 성능을 향상시키는 것.
- 희박하고 동적인 사용자-아이템 상호작용을 보이는 실세계 추천 시스템에서 온라인 클러스터링의 효과를 검증하는 것.
제안 방법
- 사용자 간 유사성 관계의 변화를 표현하기 위해 사용자 간 동적 그래프를 사용하며, 유사성이 낮은 사용자 간 간선은 피드백에 따라 점차 제거된다.
- 탐색과 이용의 균형을 이루기 위해 유사 UCB 원리를 적용하여 기대 보상의 상한 신뢰도 기반으로 아이템 목록을 선택한다.
- 사용자-아이템 상호작용 행렬에 대해 SVD를 적용하여 사용자 특징 벡터를 적응적으로 업데이트하며, 차원은 $d$로 제어된다.
- 리그레트 바운드는 $O(d\sqrt{mKT}\ln(T))$ 형식으로 유도되며, 여기서 $m$은 군집 수, $K$는 목록 길이, $T$는 시간 수평선이다.
- 목록에서 첫 번째 클릭에 대한 피드백을 통합하며, 클릭 이전의 모든 아이템을 만족스럽지 못한 것으로 간주하고 클릭 이후 피드백은 무시한다.
- 사용자 유사성 그래프의 연결 성분을 통해 군집을 동적으로 유지함으로써 군집 구조를 온라인으로 학습할 수 있다.
실험 결과
연구 질문
- RQ1프리픽스 피드백이 있는 컨텍스트 캐스케이딩 밴딧에서 사용자에 대한 온라인 클러스터링이 리그레트 성능을 향상시킬 수 있는가?
- RQ2모르는 사용자 군집을 학습하는 밴딧 알고리즘의 성능은 단일 글로벌 군집을 가정하는 알고리즘과 비교해 어떻게 다를까?
- RQ3희박한 실세계 추천 시스템에서 사용자 유사성 구조는 누적 보상에 어떤 영향을 미치는가?
- RQ4초기 라운드에서 군집 탐색 비용이 공동 필터링의 장기적 이득으로 상쇄되는가?
주요 결과
- CLUB-cascade 알고리즘은 $O(d\sqrt{mKT}\ln(T))$의 누적 리그레트 바운드를 달성하며, $m=1$인 특수한 경우에서 이전 결과를 일반화하고 개선한다.
- 합성 데이터에서 CLUB-cascade는 C3-UCB와 CascadeLinUCB를 일관되게 능가하며, 군집 수가 증가할수록 성능 향상이 두드러진다.
- MovieLens 데이터셋에서 CLUB-cascade는 약 1,000개의 타임스텝 이후 기준선 방법을 능가하지만, 군집 탐색으로 인한 초기 성능 저하가 있었다.
- Yelp 데이터셋에서는 사용자 수가 많을수록 알고리즘이 두드러진 이점을 보이며, 희박한 환경에서 공동 필터링의 강력한 이점이 드러난다.
- 알고리즘의 성능은 시간이 지남에 따라 군집 구조가 점점 더 정확해지면서 향상되며, 이는 온라인 클러스터링의 장기적 가치를 확인한다.
- 사용자 수가 많을수록 각 사용자를 개별 군집으로 간주하는 MultipleLinUCB는 CLUB-cascade에 비해 성능이 열 劣하며, 유사한 사용자 간 공유 학습의 이점이 뚜렷하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.