[论文解读] AlexU-AIC at Arabic Hate Speech 2022: Contrast to Classify
本论文提出了一种对比学习与多任务学习相结合的方法,以提升在OSACT5 2022共享任务中来自小规模、不平衡数据集的阿拉伯语仇恨言论检测性能。通过结合对比预训练、多任务微调和模型集成,该方法在三个子任务上分别取得了0.841(子任务A)、0.817(子任务B)和0.476(子任务C)的宏平均F1分数,显著优于基线模型。
Online presence on social media platforms such as Facebook and Twitter has become a daily habit for internet users. Despite the vast amount of services the platforms offer for their users, users suffer from cyber-bullying, which further leads to mental abuse and may escalate to cause physical harm to individuals or targeted groups. In this paper, we present our submission to the Arabic Hate Speech 2022 Shared Task Workshop (OSACT5 2022) using the associated Arabic Twitter dataset. The shared task consists of 3 sub-tasks, sub-task A focuses on detecting whether the tweet is offensive or not. Then, For offensive Tweets, sub-task B focuses on detecting whether the tweet is hate speech or not. Finally, For hate speech Tweets, sub-task C focuses on detecting the fine-grained type of hate speech among six different classes. Transformer models proved their efficiency in classification tasks, but with the problem of over-fitting when fine-tuned on a small or an imbalanced dataset. We overcome this limitation by investigating multiple training paradigms such as Contrastive learning and Multi-task learning along with Classification fine-tuning and an ensemble of our top 5 performers. Our proposed solution achieved 0.841, 0.817, and 0.476 macro F1-average in sub-tasks A, B, and C respectively.
研究动机与目标
- 为解决在阿拉伯语社交媒体(尤其是Twitter)中检测攻击性语言与仇恨言论的挑战,特别是在数据集规模小且不平衡的情况下。
- 通过探索对比学习与多任务学习范式,克服在有限阿拉伯语数据集上微调的Transformer模型的过拟合问题。
- 提升在三级子任务上的分类性能:攻击性语言检测、仇恨言论识别以及细粒度仇恨言论类型分类。
- 比较对比学习、多任务学习与集成方法在共享任务不同子任务中的有效性。
提出的方法
- 作者使用对比学习对阿拉伯语专用的预训练Transformer模型AraBERT进行微调,以在有限的标注数据上提升表征学习能力。
- 通过在子任务A(攻击性语言检测)和子任务B(仇恨言论检测)上联合训练,应用多任务学习,共享表征以提升泛化能力。
- 对于子任务C(细粒度仇恨言论分类),在仇恨言论推文子集上训练了独立的多任务模型,利用共享编码器特征。
- 在子任务A中使用前五名模型的集成以提升性能,而在子任务B和C中则使用专门的多任务模型。
- 对比学习目标通过对比损失函数实现,该函数促使嵌入空间中相似的推文表征彼此接近,不相似的表征彼此远离。
- 模型在来自阿拉伯语Twitter的8.8k条标注推文数据集上进行训练,采用细致的数据划分与类别平衡策略以缓解数据稀缺问题。
实验结果
研究问题
- RQ1在小规模、不平衡的数据集上,对比学习是否能提升阿拉伯语攻击性语言与仇恨言论检测的表征学习能力?
- RQ2在相关子任务(攻击性语言与仇恨言论检测)之间采用多任务学习,是否能优于单任务微调?
- RQ3在低资源阿拉伯语自然语言处理背景下,模型集成与单个模型性能相比如何?
- RQ4对比预训练与端到端微调在提升三个子任务F1分数方面的相对贡献是什么?
- RQ5联合学习细粒度仇恨言论类别是否能提升下游仇恨言论检测任务的整体分类性能?
主要发现
- 所提出的前五名模型集成在子任务A(攻击性语言检测)上取得了0.841的宏平均F1分数,显著优于基线的0.394。
- 多任务学习模型在子任务B(仇恨言论检测)上取得了0.817的宏平均F1分数,超过基线的0.472。
- 在子任务C(细粒度仇恨言论分类)中,多任务模型取得了0.476的宏平均F1分数,较基线的0.135有显著提升。
- 对比学习与多任务学习被证实能有效缓解在小规模、不平衡阿拉伯语数据集上的过拟合问题。
- 消融实验表明,将对比预训练与多任务微调相结合在所有子任务上均取得了最佳结果。
- 集成方法在子任务A上最为有效,而多任务学习在子任务B和C上表现最优,表明不同训练策略在不同任务上具有特定优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。