[论文解读] A large-scale crowdsourced analysis of abuse against women journalists and politicians on Twitter
本文通过大规模众包方式,对Twitter上针对女性记者和政治家的网络暴力行为进行了分析,使用由4,537名志愿者和三位专家标注的27.5万条推文精心构建的数据集。研究提出了一种基于BERT的模型,通过专用的暴力用语嵌入进行微调,在检测网络暴力内容方面表现出稳健性能,并公开发布了数据集,以推动网络暴力检测与社交媒体安全领域的研究进展。
We report the first, to the best of our knowledge, hand-in-hand collaboration between human rights activists and machine learners, leveraging crowd-sourcing to study online abuse against women on Twitter. On a technical front, we carefully curate an unbiased yet low-variance dataset of labeled tweets, analyze it to account for the variability of abuse perception, and establish baselines, preparing it for release to community research efforts. On a social impact front, this study provides the technical backbone for a media campaign aimed at raising public and deciders' awareness and elevating the standards expected from social media companies.
研究动机与目标
- 调查Twitter上针对女性记者和政治家的网络暴力的普遍程度及其特征。
- 通过大规模众包方式,构建一个可靠、无偏见且方差低的数据集,用于网络暴力检测。
- 利用机器学习技术,建立网络暴力内容检测的技术基础,重点关注减轻人类感知中的偏见与变异性。
- 支持媒体宣传活动,推动社交媒体平台改善网络暴力相关政策。
- 向研究社区公开高质量、已标注的数据集,以推动毒性内容检测中自然语言理解的发展。
提出的方法
- 从Twitter的Firehose中收集了220万条提及778名女性记者和政治家的推文,通过分层抽样选取21.5万条,并使用朴素贝叶斯分类器对6万条进行增强,以减少类别不平衡问题。
- 通过Amnesty Decoders平台,由4,537名在线志愿者对推文进行标注,采用多阶段界面,包含定义和示例,标注内容包括二元分类(暴力/问题/无问题)、暴力类型,以及可选的暴力传播媒介。
- 专家对568条推文子集进行标注,以验证众包标注结果,采用重要性采样方法以控制统计偏差。
- 基于已标注数据训练了一个基于BERT的深度学习模型,结合预训练的BERT编码器与针对暴力术语微调的任务特定词嵌入,使用拼接后的896维表示。
- 采用随机梯度下降算法,基于交叉熵损失函数,在90:5:5的训练/验证/测试集划分上进行端到端训练,并调整了重要性采样权重。
- 系统包含心理健康保护措施,例如在分类暴力内容后显示警告提示,以减少对标注者造成的伤害。
实验结果
研究问题
- RQ1在Twitter上,针对女性记者和政治家的网络暴力内容的普遍程度和类型是什么?
- RQ2个体对暴力的感知如何变化?这种变异性如何量化,并在标注过程中加以控制?
- RQ3在低资源、高偏见的环境下,经过微调的BERT模型结合专用暴力用语嵌入,能否有效检测网络暴力?
- RQ4大规模众包标注工作如何产生一个可靠、无偏见且可公开共享的网络暴力检测数据集?
- RQ5该数据集和模型在多大程度上可支持倡导行动,推动社交媒体平台改善网络暴力相关政策?
主要发现
- 共有15.7万条唯一推文至少被4,537名志愿者标注一次,共产生33.7万条标注结果,通过重要性采样和分层采样最大限度减少偏见。
- 数据集中有27.5万条推文被三名志愿者重复标注,一致性分析显示,对暴力的感知存在显著差异,尤其在非文本或模糊性暴力的分类上。
- 基于BERT的模型在检测网络暴力内容方面表现优异,其二元分类头在90:5:5划分上进行训练,并在BERT与专用暴力用语嵌入的联合表示上进行微调。
- 专家对568条推文进行标注以验证众包结果,采用重要性采样方法校正高风险推文选择可能带来的偏差。
- 本研究发布了公开可用的数据集和模型,为计划中的媒体宣传活动提供了技术基础,旨在推动社交媒体公司改善暴力内容的审核机制。
- 大多数暴力行为为文本形式且难以分类,相当一部分被归类为“其他”类别,凸显了暴力类型分类的复杂性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。