[论文解读] Latent Contextual Bandits and their Application to Personalized Recommendations for New Users
本文提出潜在上下文Bandits(LCB)方法,通过将用户建模为有限个潜在类别的成员,以改善新用户的个性化推荐。通过从历史用户数据中学习这些潜在类别,并利用其对早期交互进行个性化,LCB在真实世界评估中显著降低了遗憾值,并将点击率(CTR)提升最高达10%,优于当前最先进的基线方法如CLUB和Population LinUCB。
Personalized recommendations for new users, also known as the cold-start problem, can be formulated as a contextual bandit problem. Existing contextual bandit algorithms generally rely on features alone to capture user variability. Such methods are inefficient in learning new users' interests. In this paper we propose Latent Contextual Bandits. We consider both the benefit of leveraging a set of learned latent user classes for new users, and how we can learn such latent classes from prior users. We show that our approach achieves a better regret bound than existing algorithms. We also demonstrate the benefit of our approach using a large real world dataset and a preliminary user study.
研究动机与目标
- 解决个性化推荐系统中因新用户缺乏历史交互数据而产生的冷启动问题。
- 通过使用有限个潜在类别对用户行为进行建模,而非仅依赖用户特征,以提高新用户的学效率。
- 开发一种上下文Bandits算法,利用历史用户数据学习潜在用户类别,并基于最少的初始交互对新用户实现个性化推荐。
- 为所提方法提供比现有算法更紧致的理论遗憾界。
- 通过大规模真实世界数据集和初步用户研究,对方法进行实证验证。
提出的方法
- 该方法将每位用户建模为属于N个潜在类别之一,每个类别关联一个用于奖励预测的共享权重向量βh。
- 采用张量分解技术(来自Chaganty & Liang, 2013)从历史用户数据中学习潜在类别结构,从而高效表示用户异质性。
- 该算法分为两个阶段:第一阶段使用LinUCB学习用户特定参数以进行初始探索;第二阶段根据新用户的早期交互,将其分配到最可能的潜在类别。
- 潜在类别归属通过基于用户交互模式的聚类过程推断,模型参数以在线或批量方式更新。
- 该方法结合在线学习与潜在变量建模,在快速适应新用户的同时,平衡探索与利用。
- 采用两阶段学习流程:首先从历史数据中学习潜在类别;其次将新用户分配到最相似的潜在类别,以加速个性化。
实验结果
研究问题
- RQ1从历史用户数据中学习潜在类别结构,是否能显著提升上下文Bandits在新用户上的性能?
- RQ2所提出的潜在上下文Bandits与CLUB和Population LinUCB等现有算法相比,其遗憾值表现如何?
- RQ3在冷启动推荐场景中,平衡个性化与泛化能力的最优潜在类别数量是多少?
- RQ4在真实世界数据约束下(如二值化和噪声奖励),该方法表现如何?
- RQ5潜在类别模型能否在序列设置中有效进行在线更新以适应新用户?
主要发现
- 在包含10,000个新用户的Yahoo!真实世界数据集上,LCB在批量离线评估中比CLUB和Population LinUCB高出10%的点击率(CTR)。
- 当使用15或30个潜在模型时,LCB相比CLUB和Population LinUCB分别将CTR提高了5%和10%,证明了潜在结构的优势。
- 在序列在线训练中,每10,000名用户后,LCB的CTR始终比CLUB和Population LinUCB高出5%,表明其在动态环境中的鲁棒性。
- 与基线算法相比,该方法显著降低了遗憾值,且理论遗憾界比现有方法更紧致。
- 在10名参与者的初步用户研究中,LCB的CTR为0.380 ± 0.076,优于Population LinUCB的0.196 ± 0.096。
- 即使每名用户仅有20次交互,LCB仍优于CLUB,表明其在低数据场景和噪声二值奖励下的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。