[论文解读] indicnlp@kgp at DravidianLangTech-EACL2021: Offensive Language Identification in Dravidian Languages
该论文提出了一种用于代码混杂达罗毗荼语(泰米尔语-英语、马拉雅拉姆语-英语、卡纳达语-英语)中攻击性语言识别的最先进集成系统,利用多语言 BERT 和 RoBERTa 进行迁移学习,并在额外的单语英语攻击性语言数据(OLID)上进行微调。该方法在相应数据集上分别取得了加权 F1 分数 0.77、0.97 和 0.72 的成绩,分别位列第一、第二和第三名。
The paper presents the submission of the team indicnlp@kgp to the EACL 2021 shared task "Offensive Language Identification in Dravidian Languages." The task aimed to classify different offensive content types in 3 code-mixed Dravidian language datasets. The work leverages existing state of the art approaches in text classification by incorporating additional data and transfer learning on pre-trained models. Our final submission is an ensemble of an AWD-LSTM based model along with 2 different transformer model architectures based on BERT and RoBERTa. We achieved weighted-average F1 scores of 0.97, 0.77, and 0.72 in the Malayalam-English, Tamil-English, and Kannada-English datasets ranking 1st, 2nd, and 3rd on the respective tasks.
研究动机与目标
- 为解决低资源、代码混杂的达罗毗荼语数据集中的攻击性语言识别挑战。
- 通过利用迁移学习和外部单语数据,提升在低资源设置下的模型泛化能力。
- 探究结合 RNN 和变换器架构的集成模型在多语言攻击性语言检测中的有效性。
- 评估通过迁移学习对多语言 BERT 和 RoBERTa 在代码混杂文本上的数据增强影响。
- 在 EACL 2021 达罗毗荼语攻击性语言识别联合任务中实现有竞争力的排名。
提出的方法
- 使用迁移学习在代码混杂达罗毗荼语数据集上微调多语言 BERT(mBERT)和 XLM-RoBERTa(XLM-R)模型。
- 将达罗毗荼语代码混杂数据集与单语 OLID 数据集(14,000 条英语推文)结合,以改善泛化能力并缓解类别不平衡问题。
- 应用数据预处理,包括停用词去除、词形还原、表情符号替换为描述性文字,以及基于互信息的特征选择。
- 通过 ULMFiT 方法使用领域特定数据进行语言模型微调,训练 AWD-LSTM 模型。
- 通过拼接变换器模型最后一层隐藏状态的最大池化和平均池化结果,构建句子表示。
- 通过平均表现最佳的 XLM-R、mBERT 和 ULMFiT 模型的预测结果,构建集成模型以进行最终推理。
实验结果
研究问题
- RQ1能否通过单语英语攻击性语言数据(OLID)的迁移学习,提升在低资源代码混杂达罗毗荼语数据集上的性能?
- RQ2当在结合了外部数据的达罗毗荼语代码混杂数据上微调时,多语言变换器模型(mBERT、XLM-R)的效果如何?
- RQ3在攻击性语言检测中,跨多样化架构(RNN、BERT、RoBERTa)的集成学习能在多大程度上提升鲁棒性和性能?
- RQ4在更大的、合并的达罗毗荼语代码混杂文本数据集上进行微调,是否能增强对低资源语言的零样本或少样本迁移能力?
- RQ5不同的预处理策略(如表情符号替换、词形还原)对代码混杂社交媒体文本上的模型性能有何影响?
主要发现
- 集成模型在泰米尔语-英语数据集上取得了 0.77 的加权 F1 分数,在联合任务中排名第一。
- 模型在马拉雅拉姆语-英语数据集上取得了 0.97 的加权 F1 分数,位列第二。
- 模型在卡纳达语-英语数据集上取得了 0.72 的加权 F1 分数,总排名第三。
- 使用 OLID 数据集进行迁移学习显著提升了性能,尤其在较小的卡纳达语-英语数据集上效果更明显。
- 在合并数据上微调的 XLM-RoBERTa 模型在所有三个数据集上均取得了最高 F1 分数,优于 mBERT 和 ULMFiT。
- XLM-R、mBERT 和 ULMFiT 模型的集成系统表现出最强的鲁棒性和最高性能,证明了在低资源环境下模型多样性带来的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。