Skip to main content
QUICK REVIEW

[论文解读] Inferring gender of a Twitter user using celebrities it follows

Puneet Singh Ludu|arXiv (Cornell University)|May 26, 2014
Authorship Attribution and Profiling参考文献 10被引用 14
一句话总结

本文通过结合用户推文中的语言特征(使用LIWC)和名人关注模式(特别是所关注名人的性别、年龄和职业),提出了一种Twitter用户性别分类模型。通过融合语言特征与名人邻域特征,取得了85.67%的最高准确率,表明社交网络上下文显著提升了Twitter上的性别推断性能。

ABSTRACT

This paper addresses the task of user gender classification in social media, with an application to Twitter. The approach automatically predicts gender by leveraging observable information such as the tweet behavior, linguistic content of the user's Twitter feed and the celebrities followed by the user. This paper first evaluates linguistic content based features using LIWC dictionary and popular neighborhood features using Wikipedia and Freebase. Then augments both features which yielded a significant increase in the accuracy for gender prediction. Results show that rich linguistic features combined with popular neighborhood prove valuables and promising for additional user classification needs.

研究动机与目标

  • 通过使用可观测的、非侵入性特征,提升Twitter用户性别分类的准确性。
  • 探究用户所关注名人的性别、年龄和职业领域是否可作为预测用户自身性别的有效指标。
  • 评估语言特征(通过LIWC提取)与社交邻域特征(名人资料)在单独使用和组合使用时的贡献。
  • 探索基于名人的特征在社交媒体画像中作为用户标注或自报属性的可扩展替代方案的潜力。

提出的方法

  • 利用LIWC词典从每位用户的最后1000条推文中提取语言特征,重点关注与性别化语言使用相关的词类。
  • 收集并处理了265个具有验证性别标签的Twitter用户数据集,使用美国社会保障局2011年公布的前100个名字作为依据。
  • 将名人定义为关注数超过10,000或具有认证状态的用户,结果共识别出5,546个被这265名用户关注的名人账户。
  • 从维基百科和Freebase提取名人特征,包括性别(通过代词频率计算)、年龄以及“因何著名”类别(如音乐、政治、体育等)。
  • 采用混合方法(结合Metaphone与TextBrew字符串编辑距离)并辅以自定义Twitter俚语词典,对推文文本进行拼写校正以实现清洗。
  • 使用SVM分类器进行训练,采用10折交叉验证,评估不同配置下的性能表现:仅语言特征、仅邻域特征、以及组合特征。

实验结果

研究问题

  • RQ1能否通过用户推文提取的语言特征提升Twitter上性别分类的准确性?
  • RQ2用户所关注名人的性别、年龄和职业领域在多大程度上可预测用户自身的性别?
  • RQ3将语言特征与名人邻域特征相结合,是否能获得优于单独使用任一特征集的性能?
  • RQ4不同类型名人特征(如性别与职业)对性别预测的贡献如何?

主要发现

  • 语言特征(LIWC)与推文行为的结合使性别分类准确率达到82.26%。
  • 仅关注名人的性别一项即达到71.57%的准确率,表明其在性别推断中具有强信号价值。
  • 名人“因何著名”类别(如音乐、政治、体育)贡献了67.23%的准确率,表明兴趣模式具有信息量。
  • 名人年龄的准确率最低,仅为56.05%,表明其对性别分类的预测能力有限。
  • 通过组合所有特征,实现了最佳整体性能,准确率达到85.67%,精确率与召回率分别为84.56%和86.82%,表现均衡。
  • 结果表明,社交邻域特征——尤其是名人性别——在用户属性推断中具有高度价值,但目前仍被严重低估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。