[论文解读] Sexism detection: The first corpus in Algerian dialect with a code-switching in Arabic/ French and English
本论文提出了首个公开可用的阿裔达里贾语仇恨言论语料库,其中夹杂阿拉伯语、法语和英语的语码转换,专门针对社交媒体上的性别歧视现象。标注者对5,000条YouTube评论进行了标注,得到一个平衡语料库(1,798条评论)和一个非平衡语料库(3,798条评论);深度学习模型,尤其是CNN,在非平衡语料库上取得了86%的F1分数,优于LSTM和Bi-LSTM模型。
In this paper, an approach for hate speech detection against women in Arabic community on social media (e.g. Youtube) is proposed. In the literature, similar works have been presented for other languages such as English. However, to the best of our knowledge, not much work has been conducted in the Arabic language. A new hate speech corpus (Arabic\_fr\_en) is developed using three different annotators. For corpus validation, three different machine learning algorithms are used, including deep Convolutional Neural Network (CNN), long short-term memory (LSTM) network and Bi-directional LSTM (Bi-LSTM) network. Simulation results demonstrate the best performance of the CNN model, which achieved F1-score up to 86\% for the unbalanced corpus as compared to LSTM and Bi-LSTM.
研究动机与目标
- 为解决阿拉伯语中仇恨言论检测缺乏标注数据集的问题,特别是针对夹杂语码转换的阿尔及利亚达里贾语。
- 构建一个针对社交媒体平台(如YouTube)上针对女性的在线评论的手动标注语料库。
- 评估多种机器学习与深度学习模型在低资源、语码转换的阿拉伯语方言环境下的性别歧视检测性能。
- 为未来在阿拉伯语仇恨言论检测领域,特别是针对性别化仇恨言论的研究建立基准。
- 通过未来整合音译和多语言语言识别技术,进一步提升检测性能。
提出的方法
- 从与女性相关的YouTube评论中自动收集数据,共获得5,000条评论的初始数据集。
- 三位母语为阿尔及利亚达里贾语的标注者依据标准化指南,将评论标注为仇恨或非仇恨内容。
- 选取3,798条所有标注者意见一致的评论,构建非平衡语料库(3,006条非仇恨,792条仇恨)。
- 从一致标注集合中随机选取1,798条评论,构成平衡子集,用于对比评估。
- 在语料库上训练并评估多种机器学习模型(LSVC、GNB、LR、SGD、RF)和深度学习模型(CNN、LSTM、Bi-LSTM)。
- 在深度学习模型中使用Word2Vec和FastText嵌入来表示文本序列。
实验结果
研究问题
- RQ1不同机器学习与深度学习模型在检测夹杂阿拉伯语、法语和英语的阿尔及利亚达里贾语中的性别歧视时表现如何?
- RQ2语料库的选择(平衡与非平衡)如何影响性别歧视检测的模型性能?
- RQ3在低资源、语码转换的阿拉伯语方言语料库上,CNN、LSTM和Bi-LSTM等深度学习模型是否能优于传统机器学习模型?
- RQ4通过音译和语言识别等预处理技术,可以实现哪些性能提升?
- RQ5如何通过手动标注且公开可用的语料库,支持未来在阿拉伯语仇恨言论检测方面的研究?
主要发现
- CNN模型在非平衡语料库上取得了最高的F1分数86%,优于LSTM和Bi-LSTM模型。
- Bi-LSTM模型在非平衡语料库上取得了85%的F1分数,表明其在语码转换文本的序列建模方面表现强劲。
- CNN模型在平衡语料库上取得了82%的F1分数,表明其在类别不平衡情况下仍具鲁棒性。
- LSVC模型在非平衡语料库上取得了80%的F1分数,显示出传统分类器中的竞争力。
- GNB和LR模型表现较差,F1分数分别为61%和72%,表明其在该任务中效果有限。
- 本研究指出,音译和多语言语言识别是未来提升模型准确性的关键改进方向。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。