Skip to main content
QUICK REVIEW

[论文解读] Lifelong Learning of Hate Speech Classification on Social Media

Jing Qian, Hong Wang|arXiv (Cornell University)|Jun 5, 2021
Hate Speech and Cyberbullying Detection参考文献 36被引用 5
一句话总结

本文提出了一种用于社交媒体细粒度仇恨言论分类的持续学习框架,结合变分表征学习(VRL)与基于LB-SOINN的记忆模块,以缓解灾难性遗忘。该方法通过将任务特定知识提炼到解耦的潜在分布中,并高效保留关键训练样本,在高任务多样性及序列长度增加的情况下,性能优于当前最先进(SOTA)的持续学习技术。

ABSTRACT

Existing work on automated hate speech classification assumes that the dataset is fixed and the classes are pre-defined. However, the amount of data in social media increases every day, and the hot topics changes rapidly, requiring the classifiers to be able to continuously adapt to new data without forgetting the previously learned knowledge. This ability, referred to as lifelong learning, is crucial for the real-word application of hate speech classifiers in social media. In this work, we propose lifelong learning of hate speech classification on social media. To alleviate catastrophic forgetting, we propose to use Variational Representation Learning (VRL) along with a memory module based on LB-SOINN (Load-Balancing Self-Organizing Incremental Neural Network). Experimentally, we show that combining variational representation learning and the LB-SOINN memory module achieves better performance than the commonly-used lifelong learning techniques.

研究动机与目标

  • 解决现有仇恨言论分类器假设数据集静态且预定义的局限性,无法适应社交媒体内容的动态演变。
  • 在由快速变化的网络话题与意识形态引起的非平稳数据分布下,实现仇恨言论分类的持续学习。
  • 缓解灾难性遗忘问题,尤其在序列任务间语义相似度较低的持续学习场景中,如推特上多样的仇恨团体意识形态。
  • 开发一种可扩展且鲁棒的方法,在无需从头开始重新训练的前提下,维持在不断增长的仇恨言论分类任务序列中的高性能。

提出的方法

  • 提出一种新颖的持续细粒度仇恨言论分类任务,模型按仇恨意识形态分组的子数据集顺序进行训练(如反穆斯林、KKK等)。
  • 采用变分表征学习(VRL)将任务特定知识提炼到潜在变量分布中,促进知识保留并减少遗忘。
  • 引入LB-SOINN(负载均衡自组织增量神经网络)记忆模块,动态选择并存储每个任务训练数据中最具代表性的样本。
  • 采用双分支架构:一个分支用于基于VAE的表征学习并施加KL散度正则化,另一个分支用于任务特定分类。
  • 通过LB-SOINN实现VRL与记忆回放的结合,稳定新任务的学习,同时保持对先前任务的性能。
  • 利用VAE中的多变量高斯先验,鼓励生成结构良好、可聚类的隐藏表征,从而增强LB-SOINN的拓扑学习能力。

实验结果

研究问题

  • RQ1当引入新且不相似的任务时,该持续学习框架能否有效维持对先前学习过的仇恨言论分类任务的性能?
  • RQ2VRL与LB-SOINN记忆模块的结合相较于标准持续学习基线方法(如EWC、GEM、RMR)在缓解灾难性遗忘方面表现如何?
  • RQ3隐藏表征的质量——特别是其分布结构——是否会影响基于记忆的回放在持续学习中的有效性?
  • RQ4为何在顺序训练中早期任务的性能会显著下降?是否可通过架构调整或预训练缓解此问题?

主要发现

  • 所提出的VRL + LB-SOINN方法在所有基线方法(包括EWC、GEM、RMR)中均取得显著更高的平均F1分数,尤其在任务数量增加时优势更明显。
  • 该方法优于多任务训练,表明通过适当遗忘缓解机制的顺序学习,比在混合任务上联合学习更有效。
  • 首项任务的性能在训练初期显著下降,原因是VAE中重构损失优化不足,但随着任务数量增加,该差距迅速缩小。
  • 移除记忆表征上的KL散度损失项($D_{KLmem}$)会损害性能,且任务数量越多影响越明显,证实其在知识提炼与遗忘预防中的关键作用。
  • LB-SOINN在记忆效率与稳定性方面优于RMR,因其更有效地利用了VRL生成的结构化、类高斯的潜在表征。
  • 该方法对任务间相似度较低具有鲁棒性,表现为低平均Jaccard指数(如基督教身份为0.019),但仍能保持在多样化仇恨团体意识形态间的强泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。