Skip to main content
QUICK REVIEW

[论文解读] Let-Mi: An Arabic Levantine Twitter Dataset for Misogynistic Language

Hala Mulki, Bilal Ghanem|arXiv (Cornell University)|Mar 18, 2021
Hate Speech and Cyberbullying Detection参考文献 25被引用 13
一句话总结

本文提出了 Let-Mi,这是首个用于检测黎凡特阿拉伯语中性别歧视语言的基准数据集,涵盖 6,550 条在推特上手动标注的推文,分为七个性别歧视类别。使用最先进模型(包括多任务学习 MTL)进行评估后,该数据集在性别歧视检测任务中表现出色,MTL 在关键任务上的 F1 分数最高提升了 4%,标志着在应对阿拉伯语社交媒体中基于性别的网络暴力方面迈出了关键一步。

ABSTRACT

Online misogyny has become an increasing worry for Arab women who experience gender-based online abuse on a daily basis. Misogyny automatic detection systems can assist in the prohibition of anti-women Arabic toxic content. Developing such systems is hindered by the lack of the Arabic misogyny benchmark datasets. In this paper, we introduce an Arabic Levantine Twitter dataset for Misogynistic language (LeT-Mi) to be the first benchmark dataset for Arabic misogyny. We further provide a detailed review of the dataset creation and annotation phases. The consistency of the annotations for the proposed dataset was emphasized through inter-rater agreement evaluation measures. Moreover, Let-Mi was used as an evaluation dataset through binary/multi-/target classification tasks conducted by several state-of-the-art machine learning systems along with Multi-Task Learning (MTL) configuration. The obtained results indicated that the performances achieved by the used systems are consistent with state-of-the-art results for languages other than Arabic, while employing MTL improved the performance of the misogyny/target classification tasks.

研究动机与目标

  • 为解决缺乏阿拉伯语性别歧视数据集,特别是黎凡特阿拉伯语方言数据集的问题。
  • 创建一个高质量、人工标注的阿拉伯语社交媒体性别歧视语言检测数据集。
  • 在所提出的数据集上评估最先进机器学习模型在性别歧视检测任务中的表现。
  • 研究多任务学习(MTL)对提升性别歧视和目标检测分类性能的影响。
  • 为未来在阿拉伯语网络仇恨言论中研究反讽、多标签分类及文化细微差别的研究提供基础。

提出的方法

  • 数据集从黎巴嫩 17 月 10 日 2019 年抗议活动期间的推特中收集,重点关注针对女性记者的推文。
  • 标注者为母语为黎凡特阿拉伯语的人员,将每条推文标注为中性或七个性别歧视类别之一:贬低、支配、辱骂/谴责、性骚扰、刻板印象/物化、偏离话题、暴力威胁。
  • 通过 Cohen’s Kappa 和 Krippendorff’s alpha 测量标注者间的一致性,以确保标注的一致性。
  • 使用最先进模型(包括 BERT 和多任务学习 MTL 配置)在二分类和多分类任务上对数据集进行评估。
  • 进行了错误分析,以识别诸如反讽、混合标签、罕见类别和误判性别歧视案例等挑战。
  • 未来工作计划推出数据集的多标签版本,以捕捉属于多个性别歧视类别的推文。

实验结果

研究问题

  • RQ1最先进模型在推特上检测黎凡特阿拉伯语中性别歧视语言的效率如何?
  • RQ2多任务学习在阿拉伯语性别歧视和目标分类任务中能在多大程度上提升性能?
  • RQ3在阿拉伯语中,特别是黎凡特方言中,分类性别歧视内容的主要挑战是什么?
  • RQ4文化表达、反讽和独特的侮辱性短语如何影响模型的泛化能力和分类准确性?
  • RQ5一个用于阿拉伯语性别歧视检测的基准数据集能否支持在多样化自然语言处理任务中的一致且可靠的模型评估?

主要发现

  • Let-Mi 数据集实现了较高的标注者间一致性,Cohen’s Kappa 和 Krippendorff’s alpha 表明标注过程具有很强的一致性。
  • 最先进模型在性能上可与非阿拉伯语语言中的最先进结果相媲美,证明了该数据集在跨语言仇恨言论检测中的实用性。
  • 多任务学习(MTL)在性别歧视和目标分类任务上的 F1 分数平均提升了 4%,表明其在低资源环境下的有效性。
  • 类别分类任务表现较低(F1 = 0.34),主要由于 derailing、dominance 和 sexual harassment 等低资源类别训练样本较少。
  • 反讽、混合标签、独特的谴责短语以及误判的性别歧视案例被确定为误分类的主要原因,尤其是在语义细微或文化特定的表达中。
  • 数据集中包含中性及非针对女性的攻击性推文,凸显了在一般毒性内容与性别歧视内容之间进行区分的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。