Skip to main content
QUICK REVIEW

[论文解读] Gender Prediction in Social Media

James Smith|arXiv (Cornell University)|Jul 8, 2014
Authorship Attribution and Profiling参考文献 10被引用 6
一句话总结

本文提出了一种启发式方法,仅使用Fotolog平台的用户名和关注者数据进行社交媒体上的性别预测,通过在用户名中搜索与女性相关的名称和术语,实现了64.70%的准确率。该方法利用有限用户数据中的语言和社交线索,表明即使输入信息极少,用户名中的性别特定命名模式也能产生有意义的预测结果。

ABSTRACT

In this paper, we explore the task of gender classification using limited network data with an application to Fotolog. We take a heuristic approach to automating gender inference based on username, followers and network structure. We test our approach on a subset of 100,000 nodes and analyze our results to find that there is a lot of value in these limited information and that there is great promise in further pursuing this approach to classification.

研究动机与目标

  • 开发一种仅使用最少社交媒体数据(如用户名和关注者数量)的可推广性别预测方法。
  • 评估用户名中的性别特定命名模式是否与实际性别相关,尤其是在真实姓名不可用的情况下。
  • 探索无需依赖复杂机器学习或大规模训练数据的启发式技术。
  • 评估在Fotolog平台上仅使用有限公开网络特征进行性别预测的可行性。
  • 识别可提升预测准确率的关键语言和社交线索,而无需完整用户资料。

提出的方法

  • 作者基于文化刻板印象和用户名中常见用法,构建了一个包含女性相关名称和术语(如“girl”、“love”、“Taylor”)的列表。
  • 对每个用户的用户名进行精确子串匹配,检查是否包含女性术语列表中的内容,若匹配则将用户标记为女性。
  • 对于未匹配的用户,采用概率分配方法——70%概率为女性,30%概率为男性,基于Fotolog用户群体中估计的性别分布。
  • 通过测试不同变体对算法进行迭代优化,包括先仅使用女性姓名,随后逐步添加常见性别化术语以提升准确率。
  • 在84,589名已知性别的Fotolog用户子集上评估该算法,排除15,411名性别标签缺失的用户。
  • 最终模型结合女性姓名匹配与额外性别化术语,成为所有测试配置中准确率最高的版本。

实验结果

研究问题

  • RQ1是否可以仅使用社交媒体平台的用户名和关注者数据,实现具有合理准确率的性别预测?
  • RQ2用户名中的性别特定名称和术语在多大程度上与实际用户性别相关?
  • RQ3与仅基于姓名的启发式方法相比,包含非姓名性别化术语(如“love”、“girl”)是否能提升预测准确率?
  • RQ4基于人口估计的概率分配方法与确定性规则相比,在性别预测中表现如何?
  • RQ5尽管用户行为和语言使用存在差异,该启发式方法是否可推广至不同社交媒体平台?

主要发现

  • 该启发式方法在Fotolog数据集上,通过结合用户名中的女性姓名与性别化术语,最终实现了64.70%的预测准确率。
  • 仅使用用户名中的女性姓名,准确率达到63.95%,表明女性姓名与女性身份用户之间存在较强相关性。
  • 添加“girl”和“love”等常见性别化术语后,准确率从63.95%提升至64.70%。
  • 50/50随机分配基线准确率降至60%,证实该启发式方法优于简单猜测。
  • 当仅依赖热门话题搜索时,准确率表现较差(约40%),表明此类术语在此情境下效用有限。
  • 当同时使用男性和女性姓名列表时,模糊子串(如“Bert”出现在“Robert”中)的存在可能降低准确率,表明需要更智能的子串匹配机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。