[论文解读] Kungfupanda at SemEval-2020 Task 12: BERT-Based Multi-Task Learning for Offensive Language Detection
本文提出了一种基于 BERT 的多任务学习模型,用于社交媒体中的攻击性语言检测,通过联合训练三个分层子任务:攻击性语言检测(A)、分类(B)和目标识别(C)。该方法仅使用 OLID 数据集,在 SemEval-2020 任务 12 子任务 A 上实现了 91.51% 的宏平均 F1 分数,位列 85 份提交中的第 7 名,表明使用共享 BERT 表示的多任务学习相较于单任务微调可显著提升性能。
Nowadays, offensive content in social media has become a serious problem, and automatically detecting offensive language is an essential task. In this paper, we build an offensive language detection system, which combines multi-task learning with BERT-based models. Using a pre-trained language model such as BERT, we can effectively learn the representations for noisy text in social media. Besides, to boost the performance of offensive language detection, we leverage the supervision signals from other related tasks. In the OffensEval-2020 competition, our model achieves 91.51% F1 score in English Sub-task A, which is comparable to the first place (92.23%F1). An empirical analysis is provided to explain the effectiveness of our approaches.
研究动机与目标
- 通过利用相关子任务的多任务学习,提升社交媒体中攻击性语言检测的性能。
- 探究 BERT 的共享表示与子任务间的联合优化是否能提升检测性能。
- 评估在大规模噪声数据(SOLID)上预训练与在较小规模高质量数据集(OLID)上微调的效果差异。
- 确定相关任务(如目标识别)的监督是否能提升主要任务(攻击性语言检测)的性能。
- 分析不同损失加权与模型集成策略对宏平均 F1 分数的影响。
提出的方法
- 在 OLID 数据集上微调预训练的 BERT 模型,用于三个分层子任务:攻击性分类(A)、分类(B)和目标识别(C)。
- 通过在所有三个子任务中共享 BERT 编码器,并为每个子任务使用独立的分类头,实现多任务学习。
- 使用子任务 A、B 和 C 的交叉熵损失加权组合进行模型优化,损失权重分别为 0.4、0.3 和 0.3。
- 通过最多 20 个周期的早停法与学习率调度(初始值 3e-6,批量大小 32)防止过拟合。
- 通过五组独立初始化的 MTL 模型进行多数投票,以提升泛化能力与鲁棒性。
- 通过在 OLID 上的交叉验证,采用 0.3 的阈值将 SOLID 的 AVG_CONF 分数转换为二元标签。
实验结果
研究问题
- RQ1在攻击性语言检测、分类和目标识别之间进行联合学习,是否能提升主要检测任务的性能?
- RQ2在大规模噪声数据(SOLID)上进行预训练,并对置信度分数使用回归损失,是否能提升在 OLID 上的下游性能?
- RQ3与单任务微调相比,使用共享 BERT 表示的多任务学习在宏平均 F1 分数上的表现如何?
- RQ4模型集成与超参数调优对检测性能有何影响?
- RQ5为何在 SOLID 上进行预训练并未提升性能,尽管其数据规模庞大?
主要发现
- 多任务学习模型在 SemEval-2020 任务 12 子任务 A 的官方测试集上实现了 91.51% 的宏平均 F1 分数,位列 85 份提交中的第 7 名。
- 通过不同随机初始化的五组 MTL 模型集成获得最佳性能,表明多样性可提升泛化能力。
- 在 SOLID 上使用置信度分数的均方误差损失进行预训练并未提升性能,甚至略有下降,可能由于数据噪声所致。
- 基于 BERT 的多任务模型优于在 OLID 上进行单任务微调的 BERT 模型,宏平均 F1 分数绝对提升了 1.38%(从 82.03% 提升至 83.41%)。
- 该模型在 SOLID 上的表现与 OLID 一致,表明其在不同数据质量下均具有鲁棒性。
- 结果证实,多任务学习能有效捕捉内部任务关系(例如,若 B 为 NULL,则 A 必须为 NOT),从而增强预测的确定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。