Skip to main content
QUICK REVIEW

[论文解读] WLV-RIT at GermEval 2021: Multitask Learning with Transformers to Detect Toxic, Engaging, and Fact-Claiming Comments

Skye Morgan, Tharindu Ranasinghe|arXiv (Cornell University)|Jul 30, 2021
Hate Speech and Cyberbullying Detection被引用 4
一句话总结

本论文介绍了 WLV-RIT 团队在 GermEval 2021 中的参赛作品,提出了一种使用德语优化的 Transformer 模型——gBERT 和 gELECTRA 的多任务学习(MTL)方法,用于联合检测有毒、具有吸引力以及陈述事实的评论。多任务学习在所有三项任务中均显著优于单任务学习,最佳系统在事实陈述类评论上的 F1 得分为 0.7653,在具有吸引力的评论上的 F1 得分为 0.7198。

ABSTRACT

This paper addresses the identification of toxic, engaging, and fact-claiming comments on social media. We used the dataset made available by the organizers of the GermEval-2021 shared task containing over 3,000 manually annotated Facebook comments in German. Considering the relatedness of the three tasks, we approached the problem using large pre-trained transformer models and multitask learning. Our results indicate that multitask learning achieves performance superior to the more common single task learning approach in all three tasks. We submit our best systems to GermEval-2021 under the team name WLV-RIT.

研究动机与目标

  • 为解决在德语社交媒体平台上检测多种用户评论类型(有毒、具有吸引力、事实陈述)的挑战。
  • 探究使用共享 Transformer 表示的多任务学习(MTL)是否能提升在这些相关分类任务上的性能,相较于单任务学习(STL)。
  • 评估在多任务学习背景下,预训练语言模型(LM)微调对模型性能的影响。
  • 比较多语言 BERT(mBERT)与德语专用的大规模语言模型(gBERT 和 gELECTRA)在该共享任务中的有效性。
  • 提交表现最佳的系统至 GermEval 2021 共享任务,并分析其在测试集上的性能表现。

提出的方法

  • 在 GermEval 2021 数据集上微调大型预训练 Transformer 模型——mBERT、gBERT 和 gELECTRA,用于三个相关分类任务。
  • 实施了一个多任务学习(MTL)框架,使单个模型能够同时预测所有三个标签(有毒、具有吸引力、事实陈述)。
  • 将 MTL 与单任务学习(STL)进行比较,以评估共享表示学习带来的性能提升。
  • 在微调过程中引入掩码语言建模(MLM)作为辅助目标(LM),以提升泛化能力。
  • 通过使用五个不同随机种子的模型进行多数投票,以增强预测的鲁棒性。
  • 基于验证集性能优化超参数(初始峰值学习率 = 1e-5,训练轮数 = 3,批量大小 = 8),并应用早停策略。

实验结果

研究问题

  • RQ1与单任务学习相比,使用共享 Transformer 表示的多任务学习是否能提升对有毒、具有吸引力及事实陈述类评论的检测性能?
  • RQ2在该多标签分类任务中,德语专用的大规模语言模型(gBERT、gELECTRA)与多语言 BERT(mBERT)相比表现如何?
  • RQ3在多任务设置中,通过掩码语言建模(LM)进行预训练在多大程度上能提升性能?
  • RQ4哪种模型架构与训练策略组合(MTL 与 STL,LM 与无 LM)能在所有三项任务中取得最高的 F1 得分?
  • RQ5在德语社交媒体文本等低资源 NLP 场景中,通过相关任务间的共享学习,是否能降低计算成本并提升性能?

主要发现

  • 多任务学习(MTL)在所有三项任务中均持续优于单任务学习(STL),且 MTL 设置下取得了最高的 F1 得分。
  • 结合语言建模(LM)与 MTL 的 gELECTRA 模型表现最佳,其在有毒评论上的 F1 得分为 0.7342,在具有吸引力的评论上为 0.7198,在事实陈述类评论上为 0.7653。
  • gELECTRA 和 gBERT 在所有任务中均优于 mBERT,表明语言特定的预训练能提升德语文本上的性能表现。
  • 在微调过程中引入语言建模(LM)目标,在多个配置中均带来了性能提升,尤其在 MTL 设置下效果显著。
  • 表现最佳的模型(gELECTRA 搭配 LM+MTL、gELECTRA 仅使用 MTL、gBERT 搭配 LM+MTL)在所有三项任务的测试集中均位列前三。
  • 结果证实,通过 MTL 实现的共享表示学习能够增强泛化能力与效率,尤其在语义相关的任务中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。