[论文解读] Examining a hate speech corpus for hate speech detection and popularity prediction
本文对广泛使用的 Twitter 恶意言论语料库在恶意言论检测与传播度预测中的应用进行了批判性评估,复现了先前的检测结果,但 F1 得分略低(0.71 vs. 0.74),并发现恶意言论推文严重集中于少数用户,导致检测与传播度模型产生偏差。研究进一步表明,恶意言论会负面影响点赞与回复,但对转发无显著影响,且仅基于恶意言论推文建模可提升转发预测性能。
As research on hate speech becomes more and more relevant every day, most of it is still focused on hate speech detection. By attempting to replicate a hate speech detection experiment performed on an existing Twitter corpus annotated for hate speech, we highlight some issues that arise from doing research in the field of hate speech, which is essentially still in its infancy. We take a critical look at the training corpus in order to understand its biases, while also using it to venture beyond hate speech detection and investigate whether it can be used to shed light on other facets of research, such as popularity of hate tweets.
研究动机与目标
- 使用广泛引用的 Twitter 语料库复现并验证先前的恶意言论检测结果。
- 调查该语料库是否可用于预测恶意言论推文的传播度,重点关注点赞、回复与转发。
- 对语料库进行定量与定性分析,以揭示用户分布与标注中潜在的偏差。
- 评估在数据稀缺与社交媒体内容易逝的背景下,恶意言论研究的可复现性。
- 指出当前恶意言论数据集的局限性,并倡导对模型结果进行更审慎的解读。
提出的方法
- 使用与原始研究相同的模型架构与超参数复现恶意言论检测。
- 利用 Tweepy API 从原始语料库提取推文与元数据,以应对随时间推移推文可用性变化的问题。
- 将种族主义与性别歧视标签合并为单一的“恶意言论”类别,以缓解类别不平衡与用户偏移问题。
- 利用推文文本与元数据特征,训练二分类模型以预测点赞、回复与转发的可能性。
- 开展特征重要性分析,以理解哪些语言与社交特征影响传播度预测。
- 对语料库进行定量与定性分析,重点关注用户层面的不平衡与标注一致性。
实验结果
研究问题
- RQ1在使用相同语料库与方法论的前提下,原始恶意言论检测结果在多大程度上可被复现?
- RQ2该恶意言论语料库是否可用于预测恶意言论推文的传播度(以点赞、回复与转发衡量)?
- RQ3语料库中用户层面的不平衡如何影响恶意言论检测与传播度预测模型的泛化能力?
- RQ4语料库中存在哪些偏差,特别是用户分布与标注一致性方面的偏差?
- RQ5仅包含恶意言论推文的模型对传播度预测性能有何影响?
主要发现
- 恶意言论检测的复现结果 F1 得分为 0.71,略低于原始研究报告的 0.74,凸显了因方法论文档不完整而导致的可复现性挑战。
- 该语料库存在极端的用户层面不平衡,仅 5 名用户就占所有恶意言论推文的 80%,严重削弱了其代表性。
- 恶意言论推文显著更少获得点赞与回复,但对转发概率无显著影响。
- 仅基于恶意言论推文训练的模型在预测转发方面表现优于通用模型,表明恶意言论内容可能携带独特的可转发性信号。
- 特征分析显示,如冒犯性词汇与目标群体指涉等语言标记,是点赞与回复低参与度的强预测因子。
- 本研究结论认为,尽管该语料库在研究中仍具价值,但其偏差(尤其是用户与类别不平衡)在解读结果时必须被谨慎对待。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。