[论文解读] Exploring Transformer Based Models to Identify Hate Speech and Offensive Content in English and Indo-Aryan Languages
本论文评估了基于Transformer的模型,特别是XLM-RoBERTa-large,在英语和德拉维达语系语言(印地语、马拉地语、英印混合语)中检测仇恨言论和攻击性内容的表现。通过在FIRE 2021共享任务数据上使用类别加权和微调,XLM-RoBERTa-large在英印混合语任务中获得第二名(宏平均F1:0.7107),在印地语二分类任务中获得第二名(0.7797),在马拉地语任务中获得第三名(0.8756),优于mBERT和专门设计的模型如IndicBERT。
Hate speech is considered to be one of the major issues currently plaguing online social media. Repeated and repetitive exposure to hate speech has been shown to create physiological effects on the target users. Thus, hate speech, in all its forms, should be addressed on these platforms in order to maintain good health. In this paper, we explored several Transformer based machine learning models for the detection of hate speech and offensive content in English and Indo-Aryan languages at FIRE 2021. We explore several models such as mBERT, XLMR-large, XLMR-base by team name "Super Mario". Our models came 2nd position in Code-Mixed Data set (Macro F1: 0.7107), 2nd position in Hindi two-class classification(Macro F1: 0.7797), 4th in English four-class category (Macro F1: 0.8006) and 12th in English two-class category (Macro F1: 0.6447).
研究动机与目标
- 为解决在低资源德拉维达语系语言(包括印地语、马拉地语及英印混合语)中检测仇恨言论和攻击性内容的挑战。
- 评估多语言及专用于多语言的Transformer模型在低资源环境下仇恨言论检测的有效性。
- 研究类别不平衡及数据平衡技术对低资源语言分类任务中模型性能的影响。
- 比较最先进的模型(如mBERT、XLM-RoBERTa、IndicBERT和dehateBERT)在多语言和低资源环境下的表现。
- 分析模型在不同随机种子下的鲁棒性,特别是在低资源语言场景中。
提出的方法
- 在FIRE 2021共享任务数据集上微调多语言Transformer模型,包括XLM-RoBERTa-base、XLM-RoBERTa-large、mBERT-base、IndicBERT和dehateBERT。
- 在二分类(HOF vs. NOT)和四分类(HATE、OFFN、PRFN、NONE)任务中应用类别加权以缓解数据不平衡问题。
- 使用Hugging Face和PyTorch进行模型训练,采用Adam优化器和交叉熵损失,对目标数据集进行20轮微调。
- 针对英印混合数据,采用自定义微调的XLM-RoBERTa-large模型,性能优于标准变体。
- 通过多种语言和任务配置(包括英语、印地语、马拉地语和英印混合数据)的宏平均F1分数评估模型性能。
- 通过多次随机种子实验,评估模型在不同运行中的性能稳定性与方差。
实验结果
研究问题
- RQ1多语言Transformer模型在检测低资源德拉维达语系语言(如印地语和马拉地语)中的仇恨言论和攻击性内容时表现如何?
- RQ2在低资源仇恨言论检测中,XLM-RoBERTa-large、mBERT与专门设计的模型(如IndicBERT和dehateBERT)相比,其相对有效性如何?
- RQ3类别加权在多语言仇恨言论分类中对不平衡数据集的模型性能提升程度如何?
- RQ4性能结果在不同随机种子下有多稳定,特别是XLM-RoBERTa与mBERT相比?
- RQ5为何专门设计的模型(如IndicBERT和dehateBERT)在此低资源设置下表现不如通用多语言模型?
主要发现
- 在英语四分类任务中,XLM-RoBERTa-large取得了0.8006的最高宏平均F1分数,位列竞赛第二名。
- 在印地语二分类任务中,mBERT表现最佳,宏平均F1为0.7797,总排名第二。
- 对于英印混合数据,自定义微调的XLM-RoBERTa-large模型取得了0.7107的宏平均F1分数,在共享任务中位列第二。
- 在赛后评估中,XLM-RoBERTa-large在马拉地语数据集上取得了0.8756的宏平均F1分数,与第三名队伍持平。
- 与mBERT(波动范围6-7%)相比,XLM-RoBERTa模型在不同随机种子下的性能波动显著更低(最大仅1-2%)。
- 尽管专为印度语言或仇恨言论检测设计,IndicBERT和dehateBERT的表现仍逊于XLM-RoBERTa和mBERT。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。