QUICK REVIEW
[论文解读] You too Brutus! Trapping Hateful Users in Social Media: Challenges, Solutions & Insights
Mithun Das, Punyajoy Saha|arXiv (Cornell University)|Aug 1, 2021
Hate Speech and Cyberbullying Detection参考文献 47被引用 7
一句话总结
本文提出了一种半监督图神经网络(AGNN)模型,结合文本特征与社交网络结构,以检测社交媒体中的仇恨用户,在仅使用5%标注数据的情况下实现了最先进性能。AGNN模型在Gab平台上的宏平均F1得分为0.791,在Twitter平台上的得分为0.780,优于完全监督模型,并在零样本跨平台设置中表现出良好泛化能力,通过学习仇恨用户的独特网络邻域特征实现。
ABSTRACT
This upload contains the labeled Gab data, posts and network described in You too Brutus! Trapping Hateful Users in Social Media: Challenges, Solutions & Insights.
研究动机与目标
- 为解决仅依赖文本的仇恨言论检测的局限性,通过引入社交网络结构以实现更鲁棒的仇恨用户识别。
- 探究基于图的模型在低数据环境下用于仇恨用户检测的可行性和性能表现。
- 分析学习到的网络特征在零样本跨平台设置下的泛化能力。
- 通过训练好的模型,深入理解Gab平台上仇恨言论及其针对模式在不同社群中的演变过程。
- 发布一个包含423名仇恨用户和375名非仇恨用户的新型标注数据集,以支持未来研究。
提出的方法
- AGNN模型将文本表示(来自doc2vec和BERT)与图嵌入通过图神经网络进行融合,注意力机制用于关注邻近结构。
- 用户节点基于社交媒体资料构建,边代表Gab平台上的关注关系或Twitter平台上的转发关系。
- 采用半监督训练策略,模型仅使用5%的标注数据对文本特征和图特征进行联合训练。
- 模型利用注意力机制评估邻近节点的重要性,捕捉仇恨用户群体的结构特征。
- 在多个基线模型上进行评估,包括LSTM、GCN、GraphSAGE以及传统的NLP模型(如doc2vec + 逻辑回归)。
- 在完整Gab数据集上对训练好的AGNN模型进行事后分析,以研究仇恨用户的时序趋势与针对行为。
实验结果
研究问题
- RQ1在标注数据有限的情况下,结合文本与网络特征的图模型是否能优于纯文本模型,以检测仇恨用户?
- RQ2在零样本设置下,于一个社交平台(如Gab)上训练的模型在另一个平台(如Twitter)上的泛化能力如何?
- RQ3哪些结构化的网络特征可将仇恨用户与非仇恨用户区分开来,这些特征如何提升模型性能?
- RQ4仇恨用户如何随时间针对特定社群,其行为中出现了哪些语言与网络模式?
- RQ5当仇恨内容稀疏或经过编码时,传统NLP模型在多大程度上会失效,AGNN模型如何克服这一问题?
主要发现
- AGNN模型仅使用5%的标注训练数据,在Gab数据集上达到0.791的宏平均F1得分,在Twitter数据集上达到0.780,优于所有完全监督模型。
- AGNN模型在零样本跨平台设置中表现出良好泛化能力,表明学习到的网络邻域特征可在不同平台间有效迁移。
- 错误分析显示,纯文本模型如doc2vec在用户帖子中仇恨关键词不频繁时会失效,而AGNN通过利用网络结构正确分类了这些用户。
- 超过50%的仇恨用户同时针对多个边缘化社群,其中“黑人-犹太人”是被最频繁针对的组合。
- 时序分析显示,现实世界事件(如恐怖袭击、集会活动)与仇恨言论标签(如#BanIslam和#UniteTheRight)的激增存在显著相关性。
- 模型识别出对极端主义人物(如Tommy Robinson)的支持常通过趋势话题标签体现,表明存在有组织的在线动员行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。