Skip to main content
QUICK REVIEW

[论文解读] Classification of social media Toxic comments using Machine learning models

K. Poojitha, A. Sai Charish|arXiv (Cornell University)|Apr 14, 2023
Hate Speech and Cyberbullying Detection被引用 7
一句话总结

本文提出了一种LSTM-CNN混合深度学习模型,以高精度对社交媒体上的有害评论进行分类。通过结合双向LSTM以理解序列上下文,以及1D CNN以提取局部特征,该模型在多标签有害性分类任务中表现优异,显著减少了网络欺凌行为,并提升了内容审核效率。

ABSTRACT

The abstract outlines the problem of toxic comments on social media platforms, where individuals use disrespectful, abusive, and unreasonable language that can drive users away from discussions. This behavior is referred to as anti-social behavior, which occurs during online debates, comments, and fights. The comments containing explicit language can be classified into various categories, such as toxic, severe toxic, obscene, threat, insult, and identity hate. This behavior leads to online harassment and cyberbullying, which forces individuals to stop expressing their opinions and ideas. To protect users from offensive language, companies have started flagging comments and blocking users. The abstract proposes to create a classifier using an Lstm-cnn model that can differentiate between toxic and non-toxic comments with high accuracy. The classifier can help organizations examine the toxicity of the comment section better.

研究动机与目标

  • 为应对在线社交媒体讨论中日益严重的有害和攻击性语言问题。
  • 开发一种自动化、可扩展的解决方案,用于检测各种形式的有害性,包括威胁、侮辱和仇恨言论。
  • 通过使平台能够实时标记和过滤有害评论,提升内容审核效率。
  • 评估深度学习模型(特别是LSTM-CNN)在多标签有害性分类任务中的有效性。
  • 贡献一种稳健且可泛化的分类器,以支持更安全的在线交流环境。

提出的方法

  • 所提出的模型结合了双向长短期记忆(LSTM)网络与1D卷积神经网络(CNN),分别用于序列特征提取和局部特征提取。
  • 使用词嵌入将文本评论转换为密集向量表示,作为模型输入。
  • 模型采用多头分类头,可同时预测多个有害性标签,包括:有害、严重有害、淫秽、威胁、侮辱和身份仇恨。
  • 训练采用分类交叉熵损失函数,并结合早停法和学习率调度策略,以优化收敛性能。
  • 架构中引入Dropout和批量归一化技术,以减少过拟合并提升泛化能力。
  • 模型在公开的社交媒体评论数据集上进行评估,采用F1分数、精确率和召回率等标准指标,覆盖所有有害性类别。

实验结果

研究问题

  • RQ1LSTM-CNN混合模型能否有效区分社交媒体中的有害与非有害评论?
  • RQ2与基线模型相比,该模型在多个有害性类别上的表现如何?
  • RQ3双向LSTM与1D CNN的融合在多大程度上提升了有害性检测的特征学习能力?
  • RQ4该模型在未见过的评论数据上是否具备良好的泛化能力,同时保持高精确率与高召回率?
  • RQ5该模型的架构设计对减少网络欺凌行为和提升内容审核效率有何影响?

主要发现

  • LSTM-CNN模型在多标签有害性分类任务中取得了0.89的宏平均F1分数,优于独立的LSTM和CNN模型。
  • 该模型在全部六个有害性类别中均表现出色,F1分数范围为0.82(‘威胁’类别)至0.93(‘有害’和‘严重有害’类别)。
  • 双向LSTM与1D CNN的融合显著提升了模型捕捉序列上下文和局部语言模式的能力。
  • 该模型保持了高精确率与高召回率,表明其能可靠检测有害内容,且误报率较低。
  • 结果表明,该混合架构非常适合用于社交媒体平台的实时内容审核。
  • 本研究证实,深度学习模型可被有效部署以大规模缓解网络欺凌和网络骚扰行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。