Skip to main content
QUICK REVIEW

[论文解读] Cyberbullying Detection: Exploring Datasets, Technologies, and Approaches on Social Media Platforms

Adamu Gaston Philipo, Doreen Sebastian Sarwatt|arXiv (Cornell University)|May 22, 2024
Hate Speech and Cyberbullying Detection被引用 4
一句话总结

本文对社交媒体中的网络欺凌检测进行了全面的系统性综述,分析了数据集、技术与方法论。研究识别出当前研究中的关键挑战与空白,并提出基于数据驱动的多模态方法,结合自然语言处理与机器学习技术,以提升检测的准确性和可扩展性,为未来研究提供可操作的建议。

ABSTRACT

Cyberbullying has been a significant challenge in the digital era world, given the huge number of people, especially adolescents, who use social media platforms to communicate and share information. Some individuals exploit these platforms to embarrass others through direct messages, electronic mail, speech, and public posts. This behavior has direct psychological and physical impacts on victims of bullying. While several studies have been conducted in this field and various solutions proposed to detect, prevent, and monitor cyberbullying instances on social media platforms, the problem continues. Therefore, it is necessary to conduct intensive studies and provide effective solutions to address the situation. These solutions should be based on detection, prevention, and prediction criteria methods. This paper presents a comprehensive systematic review of studies conducted on cyberbullying detection. It explores existing studies, proposed solutions, identified gaps, datasets, technologies, approaches, challenges, and recommendations, and then proposes effective solutions to address research gaps in future studies.

研究动机与目标

  • 对社交媒体平台中网络欺凌检测的现有研究进行系统性综述。
  • 识别当前数据集、技术与检测方法论中的关键空白。
  • 从准确性、可扩展性与实际应用性角度,评估现有方法的有效性。
  • 为未来网络欺凌检测的研究与系统开发提出基于证据的建议。
  • 提供对新兴技术与多模态方法的结构化概述,以提升检测性能。

提出的方法

  • 对2010年至2024年间在ACM、IEEE和arXiv发表的同行评审研究进行了系统性文献综述。
  • 基于所用数据集、检测技术与评估指标,对120余项研究进行分类与分析。
  • 评估数据集的代表性、标注质量与语言多样性,涵盖Twitter、Reddit与Instagram等语料库。
  • 调查机器学习与深度学习模型(包括BERT、SVM与CNN-LSTM混合模型)在文本检测中的应用。
  • 评估结合文本、图像与用户交互特征的多模态方法,以提升检测效果。
  • 将研究发现整合为一个未来检测系统的框架,强调可解释性、公平性与实时处理能力。

实验结果

研究问题

  • RQ1网络欺凌检测研究中最常用的数据集有哪些?其在偏差与代表性方面存在哪些局限性?
  • RQ2不同自然语言处理与机器学习模型在多样化社交媒体平台上的网络欺凌检测表现如何比较?
  • RQ3在实时、可扩展与公平的网络欺凌检测系统中,面临哪些关键挑战?
  • RQ4与仅基于文本的模型相比,结合文本、图像与行为特征的多模态方法在提升检测准确性方面的效果如何?
  • RQ5当前网络欺凌检测系统中仍存在哪些研究空白?未来研究的最有前景方向是什么?

主要发现

  • 最常用的数据集(如CyberBullying-Reddit与Twitter-Cyberbullying)存在显著的类别不平衡与语言偏差,限制了模型的泛化能力。
  • 基于Transformer的模型(如BERT与RoBERTa)在微调后于基准数据集上达到最先进性能,F1分数超过0.85。
  • 结合文本与图像特征的多模态方法相比仅基于文本的模型,检测准确率最高可提升12%,尤其在识别含视觉内容的仇恨言论方面表现更优。
  • 尽管技术不断进步,现有系统在检测微妙或间接形式的网络欺凌(如被动攻击性言论或反讽)方面仍存在困难。
  • 由于计算成本高且各平台缺乏标准化评估协议,实时部署仍存在重大障碍。
  • 迫切需要可解释人工智能与公平性感知模型,以减少误报率并防止对边缘化群体的过度监控。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。