Skip to main content
QUICK REVIEW

[论文解读] A large-scale crowdsourced analysis of abuse against women journalists and politicians on Twitter

Laure Delisle, Freddie Kalaitzis|arXiv (Cornell University)|Jan 31, 2019
Hate Speech and Cyberbullying Detection参考文献 6被引用 18
一句话总结

本文通过大规模众包方式,对Twitter上针对女性记者和政治家的网络暴力行为进行了分析,使用由4,537名志愿者和三位专家标注的27.5万条推文精心构建的数据集。研究提出了一种基于BERT的模型,通过专用的暴力用语嵌入进行微调,在检测网络暴力内容方面表现出稳健性能,并公开发布了数据集,以推动网络暴力检测与社交媒体安全领域的研究进展。

ABSTRACT

We report the first, to the best of our knowledge, hand-in-hand collaboration between human rights activists and machine learners, leveraging crowd-sourcing to study online abuse against women on Twitter. On a technical front, we carefully curate an unbiased yet low-variance dataset of labeled tweets, analyze it to account for the variability of abuse perception, and establish baselines, preparing it for release to community research efforts. On a social impact front, this study provides the technical backbone for a media campaign aimed at raising public and deciders' awareness and elevating the standards expected from social media companies.

研究动机与目标

  • 调查Twitter上针对女性记者和政治家的网络暴力的普遍程度及其特征。
  • 通过大规模众包方式,构建一个可靠、无偏见且方差低的数据集,用于网络暴力检测。
  • 利用机器学习技术,建立网络暴力内容检测的技术基础,重点关注减轻人类感知中的偏见与变异性。
  • 支持媒体宣传活动,推动社交媒体平台改善网络暴力相关政策。
  • 向研究社区公开高质量、已标注的数据集,以推动毒性内容检测中自然语言理解的发展。

提出的方法

  • 从Twitter的Firehose中收集了220万条提及778名女性记者和政治家的推文,通过分层抽样选取21.5万条,并使用朴素贝叶斯分类器对6万条进行增强,以减少类别不平衡问题。
  • 通过Amnesty Decoders平台,由4,537名在线志愿者对推文进行标注,采用多阶段界面,包含定义和示例,标注内容包括二元分类(暴力/问题/无问题)、暴力类型,以及可选的暴力传播媒介。
  • 专家对568条推文子集进行标注,以验证众包标注结果,采用重要性采样方法以控制统计偏差。
  • 基于已标注数据训练了一个基于BERT的深度学习模型,结合预训练的BERT编码器与针对暴力术语微调的任务特定词嵌入,使用拼接后的896维表示。
  • 采用随机梯度下降算法,基于交叉熵损失函数,在90:5:5的训练/验证/测试集划分上进行端到端训练,并调整了重要性采样权重。
  • 系统包含心理健康保护措施,例如在分类暴力内容后显示警告提示,以减少对标注者造成的伤害。

实验结果

研究问题

  • RQ1在Twitter上,针对女性记者和政治家的网络暴力内容的普遍程度和类型是什么?
  • RQ2个体对暴力的感知如何变化?这种变异性如何量化,并在标注过程中加以控制?
  • RQ3在低资源、高偏见的环境下,经过微调的BERT模型结合专用暴力用语嵌入,能否有效检测网络暴力?
  • RQ4大规模众包标注工作如何产生一个可靠、无偏见且可公开共享的网络暴力检测数据集?
  • RQ5该数据集和模型在多大程度上可支持倡导行动,推动社交媒体平台改善网络暴力相关政策?

主要发现

  • 共有15.7万条唯一推文至少被4,537名志愿者标注一次,共产生33.7万条标注结果,通过重要性采样和分层采样最大限度减少偏见。
  • 数据集中有27.5万条推文被三名志愿者重复标注,一致性分析显示,对暴力的感知存在显著差异,尤其在非文本或模糊性暴力的分类上。
  • 基于BERT的模型在检测网络暴力内容方面表现优异,其二元分类头在90:5:5划分上进行训练,并在BERT与专用暴力用语嵌入的联合表示上进行微调。
  • 专家对568条推文进行标注以验证众包结果,采用重要性采样方法校正高风险推文选择可能带来的偏差。
  • 本研究发布了公开可用的数据集和模型,为计划中的媒体宣传活动提供了技术基础,旨在推动社交媒体公司改善暴力内容的审核机制。
  • 大多数暴力行为为文本形式且难以分类,相当一部分被归类为“其他”类别,凸显了暴力类型分类的复杂性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。