Skip to main content
QUICK REVIEW

[论文解读] Online Clustering of Contextual Cascading Bandits

Shuai Li|arXiv (Cornell University)|Nov 23, 2017
Advanced Bandit Algorithms Research被引用 10
一句话总结

该论文提出 CLUB-cascade 算法,用于在线聚类上下文级联Bandit问题,其中用户偏好被划分为未知聚类,并通过用户点击行为的前缀反馈进行学习。在一般情况下,其遗憾界为 $ ilde{O}( extstyle oot{2}{T})$,在退化为单个聚类的设定下优于先前工作,在 MovieLens 和 Yelp 等真实世界数据集以及合成数据集上表现出更优性能。

ABSTRACT

We consider a new setting of online clustering of contextual cascading bandits, an online learning problem where the underlying cluster structure over users is unknown and needs to be learned from a random prefix feedback. More precisely, a learning agent recommends an ordered list of items to a user, who checks the list and stops at the first satisfactory item, if any. We propose an algorithm of CLUB-cascade for this setting and prove a $T$-step regret bound of order $ ilde{O}(\sqrt{T})$. Previous work corresponds to the degenerate case of only one cluster, and our general regret bound in this special case also significantly improves theirs. We conduct experiments on both synthetic and real data, and demonstrate the effectiveness of our algorithm and the advantage of incorporating online clustering method.

研究动机与目标

  • 解决在具有用户点击行为前缀反馈的上下文级联Bandit中,学习未知用户聚类结构的挑战。
  • 设计一种自适应学习用户相似性并利用协同过滤的算法,而无需预先知晓聚类信息。
  • 与假设单一聚类或固定用户分组的现有线性Bandit方法相比,提升累积遗憾性能。
  • 在稀疏且动态的用户-物品交互场景下,验证在线聚类在真实推荐系统中的有效性。

提出的方法

  • 该算法在用户之间构建动态图以表示不断演化的相似性关系,基于反馈逐步移除不相似用户之间的边。
  • 采用类似UCB的乐观原则,平衡探索与利用,根据期望奖励的置信上界选择项目列表。
  • 通过在用户-物品交互矩阵上应用SVD,自适应更新用户特征向量,维度由 $d$ 控制。
  • 遗憾界通过 $O(d\sqrt{mKT}\ln(T))$ 的公式推导得出,其中 $m$ 为聚类数量,$K$ 为列表长度,$T$ 为时间范围。
  • 该方法仅利用列表中首次点击的反馈,将点击前的所有项目视为不令人满意,并忽略点击后的反馈。
  • 通过用户相似性图中的连通分量动态维护聚类,支持聚类结构的在线学习。

实验结果

研究问题

  • RQ1在具有前缀反馈的上下文级联Bandit中,用户在线聚类能否提升遗憾性能?
  • RQ2学习未知用户聚类的Bandit算法性能与假设存在单一全局聚类的算法相比如何?
  • RQ3用户相似性结构对稀疏真实推荐系统中累积收益的影响是什么?
  • RQ4早期阶段聚类探索的成本是否能被协同过滤带来的长期收益所抵消?

主要发现

  • CLUB-cascade 算法实现了 $O(d\sqrt{mKT}\ln(T))$ 的累积遗憾界,该结果在 $m=1$ 的退化情况下推广并优于先前成果。
  • 在合成数据上,CLUB-cascade 在累积收益方面持续优于 C3-UCB 和 CascadeLinUCB,尤其在聚类数量增加时表现更优。
  • 在 MovieLens 数据集上,尽管因聚类探索导致初期性能滞后,CLUB-cascade 在约 1,000 个时间步后超越基线方法。
  • 在 Yelp 数据集上,当用户数量较大时,该算法展现出显著优势,表明在稀疏场景下协同过滤具有强大效益。
  • 随着聚类结构逐渐更准确,算法性能随时间持续提升,证实了在线聚类的长期价值。
  • 当用户数量较多时,将每个用户视为独立聚类的 MultipleLinUCB 表现劣于 CLUB-cascade,凸显了对相似用户共享学习的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。