Skip to main content
QUICK REVIEW

[论文解读] FHAC at GermEval 2021: Identifying German toxic, engaging, and fact-claiming comments with ensemble learning

Tobias Bornheim, Niklas Grieger|arXiv (Cornell University)|Sep 7, 2021
Natural Language Processing Techniques参考文献 21被引用 5
一句话总结

本论文提出了一种微调后的德语 BERT 与 ELECTRA 模型的集成方法,用于在 GermEval 2021 共享任务中将德语 Facebook 评论分类为有毒、吸引性及事实声明类。通过使用超过 200 个模型的软多数投票,最佳集成模型在宏平均 F1 分数上达到了 0.73,表明性能随集成规模增大而提升,且对模型构成以及多标签与单标签训练方式具有鲁棒性,尤其在大规模集成中表现稳定。

ABSTRACT

The availability of language representations learned by large pretrained neural network models (such as BERT and ELECTRA) has led to improvements in many downstream Natural Language Processing tasks in recent years. Pretrained models usually differ in pretraining objectives, architectures, and datasets they are trained on which can affect downstream performance. In this contribution, we fine-tuned German BERT and German ELECTRA models to identify toxic (subtask 1), engaging (subtask 2), and fact-claiming comments (subtask 3) in Facebook data provided by the GermEval 2021 competition. We created ensembles of these models and investigated whether and how classification performance depends on the number of ensemble members and their composition. On out-of-sample data, our best ensemble achieved a macro-F1 score of 0.73 (for all subtasks), and F1 scores of 0.72, 0.70, and 0.76 for subtasks 1, 2, and 3, respectively.

研究动机与目标

  • 研究集成规模、模型构成以及多标签与单标签训练对德语自然语言处理任务分类性能的影响。
  • 评估微调后的德语 BERT(GBERT)与 ELECTRA(GELECTRA)模型在 GermEval 2021 共享任务中的表现,以识别有毒、吸引性及事实声明类评论。
  • 确定在此情境下,多标签模型是否因利用标签相关性而优于单标签模型。
  • 分析模型架构与预训练目标对低资源德语自然语言处理设置中下游分类性能的影响。

提出的方法

  • 在包含 3,244 条匿名 Facebook 评论的 GermEval 2021 数据集上,对多语言德语 BERT(GBERT)与 ELECTRA(GELECTRA)模型进行微调。
  • 通过多个微调模型之间的软多数投票构建模型集成,以提升泛化能力与鲁棒性。
  • 使用 5 折交叉验证,通过自举法生成 1000 个不同规模(最多 100 个)的重采样集成,以研究性能趋势。
  • 比较了 100% GBERT、100% GELECTRA 以及 50/50 GBERT-GELECTRA 混合构成的集成,以及多标签与单标签分类器配置。
  • 在完整训练数据上训练并评估了 200 个多标签集成与 200 个多标签模型,以及 30 个单标签集成,用于最终提交。
  • 在所有子任务中均以宏平均 F1 作为主要评估指标,性能结果在 5 次交叉验证折叠中取平均。

实验结果

研究问题

  • RQ1增加集成成员数量是否能提升对德语有毒、吸引性及事实声明类评论分类的宏平均 F1 性能?
  • RQ2集成构成——特别是 GBERT 与 GELECTRA 模型的混合比例——是否会影响分类性能?
  • RQ3在此多分类任务中,利用标签相关性的多标签模型是否优于单标签模型?
  • RQ4在达到某一特定集成规模后,性能增益是否趋于饱和?

主要发现

  • 最佳集成模型在测试集上实现了 0.73 的宏平均 F1 分数,子任务 1(有毒性)、2(吸引性)与 3(事实声明)的 F1 分数分别为 0.72、0.70 与 0.76。
  • 分类性能随集成规模增大而提升,其中最显著的增益出现在前 15 个成员以内,但超过 30 个成员后仍持续改善。
  • 在成员数超过 30 个后,100% GELECTRA、100% GBERT 或 50/50 GBERT-GELECTRA 混合构成的集成模型均表现出相近的宏平均 F1 分数,表明任一构成方式均无显著优势。
  • 在集成规模超过 30 个时,多标签与单标签集成模型的性能无统计学显著差异,表明在此设定下标签相关性的利用对结果影响有限。
  • 提交后发现一个软件错误影响了单标签集成(30 GBERT + 30 GELECTRA)的报告分数,经更正后其宏平均 F1 分数为 0.73,与最佳集成模型一致。
  • 本研究证实,集成规模是影响性能的主导因素,超过 30 个成员后收益递减;在集成规模足够大时,模型选择(GBERT 与 GELECTRA)对最终性能的影响微乎其微。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。