[论文解读] Collective Semi-Supervised Learning for User Profiling in Social Media
本文提出了一种新型框架——集体半监督学习(CSL),通过联合建模多种社交关系(例如关注、转发)和未标注数据,提升社交媒体中的用户画像质量。通过利用马尔可夫随机场整合关系特征,并应用带有CD正则化的凸优化方法,CSL即使在标注数据有限的情况下,也能实现高精度、鲁棒且可解释的用户属性推断,如账号类型和婚姻状况。
The abundance of user-generated data in social media has incentivized the development of methods to infer the latent attributes of users, which are crucially useful for personalization, advertising and recommendation. However, the current user profiling approaches have limited success, due to the lack of a principled way to integrate different types of social relationships of a user, and the reliance on scarcely-available labeled data in building a prediction model. In this paper, we present a novel solution termed Collective Semi-Supervised Learning (CSL), which provides a principled means to integrate different types of social relationship and unlabeled data under a unified computational framework. The joint learning from multiple relationships and unlabeled data yields a computationally sound and accurate approach to model user attributes in social media. Extensive experiments using Twitter data have demonstrated the efficacy of our CSL approach in inferring user attributes such as account type and marital status. We also show how CSL can be used to determine important user features, and to make inference on a larger user population.
研究动机与目标
- 解决现有用户画像方法依赖单一数据类型和标注数据稀缺的局限性。
- 开发一种统一且计算上合理的框架,整合多样化社交关系和大规模未标注数据。
- 提升推断潜在用户属性(如账号类型和婚姻状况)的预测准确性和鲁棒性。
- 利用学习到的模型对大规模、此前未见过的用户群体实现推断。
- 通过识别关键贡献特征和关系类型,实现可解释性。
提出的方法
- 构建基于马尔可夫随机场(MRF)的特征,以统一表示方式建模多种社交关系类型(如关注、转发)。
- 通过用户连接和内容派生的关系特征扩展输入空间。
- 应用带有CD正则化的凸优化方法,在标注和未标注数据上执行半监督学习。
- 采用联合学习框架,同时优化多种关系类型和未标注样本。
- 采用结构化预测方法,通过关系先验捕捉用户之间的依赖关系。
- 利用未标注数据优化决策边界,提升模型在标注数据之外的泛化能力。
实验结果
研究问题
- RQ1如何有效整合多种类型的社交关系以提升用户属性推断性能?
- RQ2能否以系统化方式利用未标注数据以增强模型的鲁棒性和准确性?
- RQ3所提出方法在更大、未见过的用户群体上如何泛化?
- RQ4哪些特征和关系类型对预测性能贡献最大?
- RQ5模型能否识别并预测在标注训练集中未出现的新型用户类型?
主要发现
- 在前100名预测中,CSL对组织账号的预测精度达到90%,对个人账号的预测精度达到100%,且个人账号无误报。
- 在婚姻状况预测中,前60名预测的精度达到92.31%,且前100名预测中有33%被正确分类为已婚。
- 未标注的SGTwitter用户群体的预测标签分布(88%个人,12%组织)显著偏离标注数据的分布,表明模型能泛化至真实世界的数据分布。
- CSL成功预测了训练集中未出现的新域名后缀(如“.sg”)的组织账号,表明对分布外情况具有鲁棒性。
- 定性分析显示,即使用户内容中无关键词匹配,模型仍能基于内容和关系线索正确推断婚姻状况。
- 该方法通过识别对预测贡献最大的关键特征和关系类型,展现出可解释性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。