[论文解读] Abusive and Threatening Language Detection in Urdu using Boosting based and BERT based models: A Comparative Approach
本论文针对乌尔都语中的辱骂性与威胁性语言检测,提出了一项基于提升方法与BERT模型的对比研究,使用共享任务数据集。通过微调原本在阿拉伯语仇恨言论上预训练的 dehatebert-mono-arabic 模型,取得了最先进性能,在辱骂性语言检测任务中F1得分为0.88062,在威胁性语言检测任务中F1得分为0.54574,分别在FIRE 2021共享任务的两个子任务中排名第一。
Online hatred is a growing concern on many social media platforms. To address this issue, different social media platforms have introduced moderation policies for such content. They also employ moderators who can check the posts violating moderation policies and take appropriate action. Academicians in the abusive language research domain also perform various studies to detect such content better. Although there is extensive research in abusive language detection in English, there is a lacuna in abusive language detection in low resource languages like Hindi, Urdu etc. In this FIRE 2021 shared task - "HASOC- Abusive and Threatening language detection in Urdu" the organizers propose an abusive language detection dataset in Urdu along with threatening language detection. In this paper, we explored several machine learning models such as XGboost, LGBM, m-BERT based models for abusive and threatening content detection in Urdu based on the shared task. We observed the Transformer model specifically trained on abusive language dataset in Arabic helps in getting the best performance. Our model came First for both abusive and threatening content detection with an F1scoreof 0.88 and 0.54, respectively.
研究动机与目标
- 为解决乌尔都语等低资源语言在辱骂性与威胁性语言检测方面研究不足的问题。
- 评估传统机器学习模型(XGBoost、LGBM)与基于Transformer的模型(mBERT、dehatebert-mono-arabic)在乌尔都语辱骂性与威胁性语言检测中的有效性。
- 探究是否可通过对阿拉伯语仇恨言论数据预训练的模型进行微调,来提升其在乌尔都语上的性能,鉴于两者在语言与历史上的关联性。
- 在FIRE 2021共享任务中实现乌尔都语辱骂性与威胁性语言检测的顶尖性能。
- 公开发布代码与模型,以支持未来在低资源仇恨言论检测领域的研究。
提出的方法
- 采用XGBoost与LightGBM模型,并使用预训练的乌尔都语LASER嵌入作为基线模型。
- 在乌尔都语辱骂性与威胁性语言数据集上对多语言BERT(mBERT)进行微调,用于二分类任务。
- 利用dehatebert-mono-arabic模型——该模型此前已在阿拉伯语仇恨言论数据上进行过微调——进行迁移学习至乌尔都语,以利用语言上的相似性。
- 两个子任务均采用二元交叉熵损失函数,并通过类别权重缓解威胁性语言检测数据集中的类别不平衡问题。
- 使用10个周期、Adam优化器及初始0.0002学习率对Transformer模型进行训练,基于验证集F1分数实施早停策略。
- 在辱骂性语言检测中,将训练数据按85%用于训练、15%用于验证;由于类别不平衡,威胁性语言检测任务使用全部数据集。
实验结果
研究问题
- RQ1基于提升的模型(如XGBoost与LGBM)能否在低资源乌尔都语文本中有效检测辱骂性与威胁性语言?
- RQ2在乌尔都语数据上进行微调的多语言BERT模型是否相比从零开始训练或使用通用嵌入模型能提升性能?
- RQ3由于共享语言根源,是否可使在阿拉伯语仇恨言论数据上预训练的模型有效泛化至乌尔都语?
- RQ4威胁性语言检测数据集中的类别不平衡如何影响模型性能?类别权重是否能缓解此问题?
- RQ5在FIRE 2021共享任务中,不同模型在乌尔都语辱骂性与威胁性语言检测中的相对表现如何?
主要发现
- 在微调后的dehatebert-mono-arabic模型在辱骂性语言检测任务(子任务A)中取得了0.88062的最高F1得分,位列共享任务第一。
- 在威胁性语言检测任务(子任务B)中,同一模型取得了0.54574的F1得分,优于所有其他模型,尽管数据集高度不平衡,仍夺得第一。
- 传统模型(XGBoost与LGBM)表现中等,子任务A的F1得分分别为0.76072与0.76667,表明其在低资源乌尔都语文本上效果有限。
- mBERT在子任务A中取得0.84000的F1得分,在子任务B中取得0.46961,表现优于传统模型但逊于dehatebert-mono-arabic模型。
- 本研究证实,从高性能阿拉伯语仇恨言论模型迁移学习可显著提升乌尔都语上的性能,表明相关语言间存在语言迁移能力。
- 类别权重提升了模型在类别不平衡的威胁性语言数据集上的鲁棒性,但性能仍受限,表明数据不平衡仍是该任务的关键挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。