QUICK REVIEW
[论文解读] SJ_AJ@DravidianLangTech-EACL2021: Task-Adaptive Pre-Training of Multilingual BERT models for Offensive Language Identification
Sai Muralidhar Jayanthi, Akshat Gupta|arXiv (Cornell University)|Feb 1, 2021
Hate Speech and Cyberbullying Detection参考文献 20被引用 21
一句话总结
本论文提出了一种基于任务自适应微调的 mBERT 和 XLM-RoBERTa 模型集成方法,用于代码混合的德拉维达语(卡纳达语、泰米尔语、马拉雅拉姆语)中的攻击性语言识别。通过在多语言 BERT 上利用掩码语言建模进行任务特定预训练,该系统在 EACL 2021 共享任务中取得了最先进性能,卡纳达语排名首位,马拉雅拉姆语排名第二,泰米尔语排名第三。
ABSTRACT
In this paper we present our submission for the EACL 2021-Shared Task on Offensive Language Identification in Dravidian languages. Our final system is an ensemble of mBERT and XLM-RoBERTa models which leverage task-adaptive pre-training of multilingual BERT models with a masked language modeling objective. Our system was ranked 1st for Kannada, 2nd for Malayalam and 3rd for Tamil.
研究动机与目标
- 开发一种针对在自然语言处理中代表性不足的代码混合德拉维达语的稳健攻击性语言识别系统。
- 探究在低资源、代码混合的社交媒体文本上,使用掩码语言建模对多语言 BERT 模型进行任务自适应预训练的有效性。
- 通过模型集成和表示融合技术,在类别不平衡、多语言数据集上提升性能。
- 评估输入格式(本地文字 vs. 拉丁化)对模型泛化能力和鲁棒性的影响。
提出的方法
- 在每种德拉维达语的训练集和验证集合并数据上,使用掩码语言建模(MLM)对 mBERT 和 XLM-RoBERTa 进行任务自适应预训练。
- 使用 [CLS] 标记表示和 Softmax 层,对任务自适应预训练后的模型进行攻击性语言分类微调。
- 通过多数投票法,将三个 mBERT 和三个 XLM-RoBERTa 模型进行集成,以生成最终预测结果。
- 通过 BiLSTM 层拼接字符级、子词级和词级嵌入,探索表示融合方法。
- 使用 Hugging Face 的 transformers 库,采用默认超参数:5 个训练周期,批量大小为 8,基于验证集性能进行早停。
- 使用 indic-trans 工具对数据集进行音译,以进行消融研究,但未在最终模型中使用。
实验结果
研究问题
- RQ1在低资源、代码混合的德拉维达语中,使用掩码语言建模进行任务自适应预训练是否能提升攻击性语言检测性能?
- RQ2当在多语言、代码混合数据上微调时,mBERT 和 XLM-RoBERTa 在混合书写系统输入下的性能表现如何?
- RQ3通过字符级和词级 BiLSTM 进行表示融合,在不同德拉维达语中能在多大程度上提升模型性能?
- RQ4输入格式(本地文字 vs. 拉丁化)在攻击性语言检测中如何影响模型的泛化能力和鲁棒性?
主要发现
- 任务自适应预训练使所有三种语言的 F1 分数均提升了 1-2 个百分点绝对值,其中马拉雅拉姆语提升最大(最高达 2% 提升)。
- 集成模型表现最佳,在卡纳达语验证集上 F1 得分为 70.30,准确率为 74.00。
- 在验证集上,XLM-RoBERTa 在泰米尔语和马拉雅拉姆语上优于 mBERT,分别取得 76.94 和 96.76 的 F1 分数。
- 即使输入完全为拉丁化形式,基线模型仍保持较强性能,表明对书写系统变化具有鲁棒性。
- 表示融合在部分数据集上提升了性能,但在其他数据集上则导致性能下降,表明其有效性具有上下文依赖性。
- 该系统在 EACL 2021 共享任务中,卡纳达语排名第一,马拉雅拉姆语排名第二,泰米尔语排名第三,证明了其最先进性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。