[论文解读] Who are Like-minded: Mining User Interest Similarity in Online Social Networks
本文提出了一种基于标签的用户画像方法——流行标签画像(PTP)与代表性标签画像(RTP),利用人口统计与社交特征预测在线社交网络中的用户兴趣相似性,优于传统的基于视频和协同过滤的方法。一种新颖的混合树编码线性模型在预测兴趣相似性方面表现优异,尤其适用于不活跃或新用户,并提升了视频推荐的准确率与多样性。
In this paper, we mine and learn to predict how similar a pair of users' interests towards videos are, based on demographic (age, gender and location) and social (friendship, interaction and group membership) information of these users. We use the video access patterns of active users as ground truth (a form of benchmark). We adopt tag-based user profiling to establish this ground truth, and justify why it is used instead of video-based methods, or many latent topic models such as LDA and Collaborative Filtering approaches. We then show the effectiveness of the different demographic and social features, and their combinations and derivatives, in predicting user interest similarity, based on different machine-learning methods for combining multiple features. We propose a hybrid tree-encoded linear model for combining the features, and show that it out-performs other linear and treebased models. Our methods can be used to predict user interest similarity when the ground-truth is not available, e.g. for new users, or inactive users whose interests may have changed from old access data, and is useful for video recommendation. Our study is based on a rich dataset from Tencent, a popular service provider of social networks, video services, and various other services in China.
研究动机与目标
- 为解决在缺乏视频消费数据(如新用户或不活跃用户)时预测用户兴趣相似性的挑战。
- 探究人口统计特征(年龄、性别、地理位置)与社交特征(好友关系、群组成员、互动行为)在预测兴趣相似性方面的有效性。
- 开发并评估一种基于标签的用户画像方法,以克服基于视频和潜在主题建模方法(如LDA)及协同过滤方法的局限性。
- 设计一种结合树模型与线性模型的混合机器学习模型,以提升用户兴趣相似性的预测性能。
- 验证预测相似性在实际视频推荐系统中的实用价值。
提出的方法
- 提出两种基于标签的用户画像方法:流行标签画像(PTP),通过频率统计用户间共现标签数量;代表性标签画像(RTP),根据标签的代表性对标签进行加权。
- 以腾迅平台的视频访问模式作为活跃用户的真值标签,标签数据由编辑提供,构成基于众源分类的标签系统。
- 应用多种机器学习模型——包括线性模型、树模型以及一种新颖的混合树编码线性模型——基于人口统计与社交特征预测兴趣相似性。
- 该混合模型将决策树与线性回归相结合,实现自适应特征加权,并在多样化用户画像中提升泛化能力。
- 采用系统化的评估框架,比较不同特征组合与模型在预测性能上的差异。
- 在视频推荐流程中验证该方法,与基线方法(如基于视频的画像VBP)进行对比。
实验结果
研究问题
- RQ1当缺乏视频消费数据时,人口统计与社交特征在预测用户兴趣相似性方面的有效性如何?
- RQ2与基于视频或潜在主题建模方法相比,PTP与RTP在兴趣相似性预测的准确率与多样性方面表现如何?
- RQ3混合树编码线性模型是否能超越标准线性模型与树模型,在预测用户兴趣相似性方面表现更优?
- RQ4预测的兴趣相似性在多大程度上提升了视频推荐系统的准确率与多样性?
- RQ5用户当前兴趣与过去行为或平均用户兴趣之间的相似性,与人口统计与社交特征的相关性如何?
主要发现
- 混合树编码线性模型在预测用户兴趣相似性方面显著优于其他线性模型与树模型,AUC与F1得分均达到最高。
- 基于PTP的画像方法预测准确率更高(AUC最高达0.950),而RTP则通过更好地捕捉长尾兴趣,产生更具多样性的推荐。
- 该模型在不同用户群体中AUC达到0.930–0.942,F1得分范围为0.883–0.894,表明其具备强大的泛化能力。
- 社交特征(如好友关系、群组成员、互动历史)与兴趣相似性具有强相关性,尤其在与人口统计属性结合时更为显著。
- 与过去行为或平均用户兴趣的相似性是有效的预测因子,尤其适用于消费数据稀疏或过时的用户。
- 在视频推荐中,基于标签的模型(尤其是RTP)相比基于视频的画像(VBP)能产生更具多样性的推荐,有助于发现小众内容。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。