Skip to main content
QUICK REVIEW

[论文解读] #MeTooMA: Multi-Aspect Annotations of Tweets Related to the MeToo Movement

Akash Kumar Gautam, Puneet Mathur|arXiv (Cornell University)|Dec 14, 2019
Hate Speech and Cyberbullying Detection被引用 12
一句话总结

本论文介绍了#MeTooMA,一个包含9,973条与#MeToo运动相关的Twitter帖子的数据集,这些帖子经过人工标注,涵盖五种语言特征:相关性、立场、仇恨言论、反讽以及对话行为——其中包括新型类别如指控(Allegation)、反驳(Refutation)和理由说明(Justification)。该数据集具有较高的标注者间一致性(k-alpha 0.79–0.93),支持对性骚扰相关话语的多维度分析,有助于计算语言学、社会语言学以及心理语言学研究,推动数字社会运动中的话语分析。

ABSTRACT

In this paper, we present a dataset containing 9,973 tweets related to the MeToo movement that were manually annotated for five different linguistic aspects: relevance, stance, hate speech, sarcasm, and dialogue acts. We present a detailed account of the data collection and annotation processes. The annotations have a very high inter-annotator agreement (0.79 to 0.93 k-alpha) due to the domain expertise of the annotators and clear annotation instructions. We analyze the data in terms of geographical distribution, label correlations, and keywords. Lastly, we present some potential use cases of this dataset. We expect this dataset would be of great interest to psycholinguists, socio-linguists, and computational linguists to study the discursive space of digitally mobilized social movements on sensitive issues like sexual harassment.

研究动机与目标

  • 创建一个大规模、多维度标注的数据集,以捕捉Twitter上关于#MeToo运动的复杂语言表达。
  • 解决目前缺乏同时标注多种语言维度(如立场、仇恨言论、反讽和对话行为)的敏感社交媒体话语数据集的问题。
  • 通过支持相关性、立场、仇恨言论、反讽和对话行为的多标签分类任务,推动计算语言学研究。
  • 促进社会语言学与心理语言学研究,探讨边缘化声音、权力关系和社会政策如何在在线运动中表达。
  • 为未来聚焦于公平、可问责、可解释和负责任(FAIR)系统的挑战任务提供基础,用于分析社交媒体中关于性虐待的话语。

提出的方法

  • 在#MeToo运动一周年之际(2018年10月至12月)收集了9,973条与#MeToo相关的推文。
  • 对每条推文标注了五种语言特征:相关性、立场、仇恨言论、反讽以及对话行为——包括三种新型对话行为类别:指控(Allegation)、反驳(Refutation)和理由说明(Justification)。
  • 采用领域专家进行标注,并提供详细且标准化的标注指南,以确保高标注者间一致性(k-alpha 0.79–0.93)。
  • 纳入地理元数据,标明每条推文的来源国家,以支持跨国比较分析。
  • 对标签相关性、关键词分布和地理模式进行统计分析,以刻画话语格局。
  • 通过DOI(10.7910/DVN/JN4EYU)发布数据集,供公众访问并支持未来研究。

实验结果

研究问题

  • RQ1在关于性骚扰的在线话语中,不同语言成分(如立场、仇恨言论、反讽和对话行为)如何相互作用?
  • RQ2与#MeToo相关的言论在地理上如何分布?其在不同国家之间有何差异?
  • RQ3在与#MeToo运动相关的推文中,仇恨言论、反讽和立场等标签在多大程度上相互关联?
  • RQ4新型对话行为如指控(Allegation)、反驳(Refutation)和理由说明(Justification)在关于性虐待的公共话语中如何体现?
  • RQ5使用该数据集对构建公平、可问责、可解释和负责任(FAIR)的计算系统在敏感社交媒体分析中的意义是什么?

主要发现

  • 该数据集包含9,973条推文,标注者间一致性高(k-alpha范围为0.79至0.93),表明标注具有强可靠性。
  • 相关工作中曾标注18,336条与滥用相关的推文,但#MeTooMA的独特之处在于,它在单一、精心筛选的9,973条推文上提供了五种不同的语言标注。
  • 新增的三种对话行为(指控、反驳和理由说明)为建模社会运动中的话语提供了新颖框架。
  • 地理分析揭示了各国在#MeToo话语中的多样化参与,表明表达与参与方式存在跨文化差异。
  • 标签相关性分析表明,立场与仇恨言论并非相互独立,反讽常与负面立场或攻击性内容同时出现。
  • 该数据集支持多维度研究,例如研究反讽如何影响对仇恨言论的感知,或理由说明在反驳指控时的使用方式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。