[论文解读] Privacy-Aware Recommender Systems Challenge on Twitter's Home Timeline
本文引入了一个大规模、注重隐私的 Twitter Home Timeline 互动数据集,包含1.6亿条样本,旨在推动推荐系统中参与度预测的研究。该研究提出了一种基线模型,采用量化数值特征、独热编码的类别特征、哈希处理的ID以及CFRNN嵌入的推文文本,并结合三层MLP,通过多标签Sigmoid输出预测四种用户参与行为(点赞、回复、转发、带评论的转发),利用Huber损失和Adam优化器在类别不平衡数据上实现稳健性能。
Recommender systems constitute the core engine of most social network platforms nowadays, aiming to maximize user satisfaction along with other key business objectives. Twitter is no exception. Despite the fact that Twitter data has been extensively used to understand socioeconomic and political phenomena and user behaviour, the implicit feedback provided by users on Tweets through their engagements on the Home Timeline has only been explored to a limited extent. At the same time, there is a lack of large-scale public social network datasets that would enable the scientific community to both benchmark and build more powerful and comprehensive models that tailor content to user interests. By releasing an original dataset of 160 million Tweets along with engagement information, Twitter aims to address exactly that. During this release, special attention is drawn on maintaining compliance with existing privacy laws. Apart from user privacy, this paper touches on the key challenges faced by researchers and professionals striving to predict user engagements. It further describes the key aspects of the RecSys 2020 Challenge that was organized by ACM RecSys in partnership with Twitter using this dataset.
研究动机与目标
- 为解决缺乏大规模、公开的社会网络数据集以用于训练和基准测试参与度预测模型的问题。
- 通过发布与真实Twitter平台动态一致的数据集,推动隐私保护型推荐系统的研究。
- 激励研究社区利用隐式反馈改进参与度预测,特别是在实时个性化内容排序的背景下。
- 通过RecSys 2020挑战赛提供标准化基准,促进可扩展、注重隐私的推荐算法创新。
提出的方法
- 数值特征被划分为50个基于分位数的桶(包括缺失值),并进行独热编码以供模型输入。
- 类别特征(如语言)进行独热编码,并增加一个“词汇外”类别,同时根据基数进行嵌入。
- ID特征(如用户或推文ID)通过哈希处理并取模映射到固定大小的桶中,以应对高基数或未知值。
- 推文文本经过分词处理,并使用混沌自由循环神经网络(CFRNN)进行嵌入,以提升计算效率与稳定性。
- 所有特征嵌入(数值、类别、ID和文本)被拼接成一个大小为16×4 + 16 = 80的稠密向量,随后输入一个具有ReLU激活函数且神经元数递减(128, 64, 32)的三层MLP。
- 最后一层使用Sigmoid激活函数,预测四种非互斥的参与类型(点赞、回复、转发、带评论的转发),采用Huber损失和Adam优化器训练100万步。
实验结果
研究问题
- RQ1如何构建并发布大规模、注重隐私的数据集,以支持现实世界推荐系统的研究?
- RQ2仅使用隐式反馈预测用户对推文的参与度,面临哪些关键挑战?
- RQ3结合量化特征、嵌入技术与多标签学习的基线模型,在类别不平衡、高维数据上的参与度预测效果如何?
- RQ4在动态社交媒体环境中,时间等上下文特征在多大程度上能提升参与度预测性能?
- RQ5在缺乏显式用户评分的情况下,如何公平评估模型性能?采用PR-AUC与F1-score等指标在类别不平衡的参与类别上表现更优。
主要发现
- 该数据集包含1.6亿条样本,正负参与样本几乎相等,是目前公开发布的最大规模同类社交媒体数据集。
- 基线模型在100万步训练中使用Huber损失与Adam优化器(固定初始学习率为0.001)表现出稳定训练过程。
- 采用基于分位数的桶化处理数值特征,以及对高基数ID进行哈希处理,有效应对了稀疏与偏态特征分布问题。
- 模型采用Sigmoid激活的多标签输出,支持四种参与类型的非互斥预测,更符合真实用户行为。
- 评估框架强调PR-AUC与F1-score,这些指标在类别不平衡数据上比AUC更敏感,确保了性能评估的稳健性。
- 研究强调了上下文特征(如用户活跃时间)的重要性,如先前研究所示,建议未来模型应整合此类信号以提升相关性与多样性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。