[论文解读] Exploring Heterogeneous Metadata for Video Recommendation with Two-tower Model
本文提出了一种双塔神经网络模型,通过注意力融合层利用异构元数据——类别特征、文本简介和封面图像——来提升冷启动和暖启动视频的推荐效果。该模型通过自适应加权不同元数据模态,显著优于基线模型在冷启动内容上的精确率和召回率,同时在暖启动项目上也保持了强劲的表现。
Online video services acquire new content on a daily basis to increase engagement, and improve the user experience. Traditional recommender systems solely rely on watch history, delaying the recommendation of newly added titles to the right customer. However, one can use the metadata information of a cold-start title to bootstrap the personalization. In this work, we propose to adopt a two-tower model, in which one tower is to learn the user representation based on their watch history, and the other tower is to learn the effective representations for titles using metadata. The contribution of this work can be summarized as: (1) we show the feasibility of using two-tower model for recommendations and conduct a series of offline experiments to show its performance for cold-start titles; (2) we explore different types of metadata (categorical features, text description, cover-art image) and an attention layer to fuse them; (3) with our Amazon proprietary data, we show that the attention layer can assign weights adaptively to different metadata with improved recommendation for warm- and cold-start items.
研究动机与目标
- 为解决缺乏观看历史的新添加视频(冷启动)推荐难题。
- 探索不同类型元数据——类别特征、文本简介和封面图像——在提升视频表征学习方面的有效性。
- 设计一种统一的双塔架构,实现冷启动与暖启动推荐中用户和项目表征学习的高效性。
- 评估注意力融合与简单拼接在组合异构元数据模态时的影响。
- 分析在冷启动场景下使用ID嵌入与元数据表征之间的权衡。
提出的方法
- 采用双塔神经网络架构,一个塔学习基于观看历史的用户表征,另一个塔学习基于元数据的项目表征。
- 项目塔处理三种不同的元数据模态:类别特征(如类型、演员)、文本简介(通过BERT编码)和封面图像(通过预训练CNN嵌入)。
- 引入注意力层,以动态融合不同元数据模态的表征,根据其对推荐任务的相关性分配自适应权重。
- 最终的项目表征通过模态特定嵌入的加权和计算得出,其中注意力权重在训练过程中学习得到。
- 通过点积将用户和项目嵌入结合,以预测用户-项目交互得分。
- 使用Adam优化器进行训练,嵌入维度固定为512,学习率为0.001。
实验结果
研究问题
- RQ1双塔模型能否有效利用异构元数据,以提升冷启动视频的推荐效果?
- RQ2不同元数据类型——类别特征、文本简介和封面图像——在项目表征学习中分别有何贡献?
- RQ3注意力融合机制是否优于元数据表征的简单拼接?
- RQ4ID嵌入对冷启动推荐性能有何影响?其与元数据表征之间存在何种交互作用?
- RQ5注意力权重在不同元数据模态间如何分布?这揭示了它们的相对重要性如何?
主要发现
- 基于注意力的融合模型显著优于仅使用单一元数据类型的模型,证明了跨模态自适应加权的有效性。
- 类别特征对表征学习的贡献最大,其次是文本简介,而封面图像获得的注意力权重最低。
- 在冷启动推荐中,不使用ID嵌入的模型在precision@6和recall@6上优于使用ID嵌入的版本,表明ID嵌入可能主导注意力机制,抑制了有用的元数据信号。
- 与随机基线相比,采用注意力融合的模型在冷启动电影上的precision@6提升了1221.73%,recall@6提升了368.75%;在电视剧上的提升分别为486.36%和57.69%。
- 当包含ID嵌入时,覆盖率指标(Coverage@6和ConCov@6)略有提高,表明在冷启动设置中存在准确率与多样性之间的权衡。
- 可视化结果确认,类别特征获得最高的注意力权重,而封面图像特征始终被下调权重,反映出其在当前设置下信息量较低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。