Skip to main content
QUICK REVIEW

[论文解读] Session-based Cyberbullying Detection in Social Media: A Survey

Peiling Yi, Arkaitz Zubiaga|arXiv (Cornell University)|Jul 14, 2022
Hate Speech and Cyberbullying Detection被引用 4
一句话总结

本综述提出了一种基于会话的网络欺凌检测框架,用于建模社交媒体互动中的重复行为和权力失衡。该综述回顾了数据、方法和数据集创建的最佳实践,对两个数据集上的最先进模型和大语言模型进行了基准测试,并识别了未来在会话级网络欺凌检测中的关键挑战。

ABSTRACT

Cyberbullying is a pervasive problem in online social media, where a bully abuses a victim through a social media session. By investigating cyberbullying perpetrated through social media sessions, recent research has looked into mining patterns and features for modeling and understanding the two defining characteristics of cyberbullying: repetitive behavior and power imbalance. In this survey paper, we define the Session-based Cyberbullying Detection framework that encapsulates the different steps and challenges of the problem. Based on this framework, we provide a comprehensive overview of session-based cyberbullying detection in social media, delving into existing efforts from a data and methodological perspective. Our review leads us to propose evidence-based criteria for a set of best practices to create session-based cyberbullying datasets. In addition, we perform benchmark experiments comparing the performance of state-of-the-art session-based cyberbullying detection models as well as large pre-trained language models across two different datasets. Through our review, we also put forth a set of open challenges as future research directions.

研究动机与目标

  • 定义一种标准化的基于会话的网络欺凌检测框架,以捕捉社交媒体互动中的重复行为和权力失衡。
  • 回顾跨多样化社交媒体平台的基于会话的网络欺凌检测的现有数据源和方法论。
  • 建立基于证据的准则,用于创建高质量、具有代表性的基于会话的网络欺凌数据集。
  • 在两个公开数据集上对最先进基于会话的模型和大规模预训练语言模型进行基准测试。
  • 识别基于会话的网络欺凌检测中的开放性挑战和未来研究方向。

提出的方法

  • 本文提出了一种结构化框架,将基于会话的网络欺凌检测分解为数据收集、特征工程、建模和评估四个阶段。
  • 通过分析会话级特征,如消息序列模式、语言线索和互动动态,来建模重复行为和权力失衡。
  • 作者提出了一套数据集构建的最佳实践,包括会话分割、标签一致性以及欺凌者-受害者关系中的数据平衡。
  • 基准测试使用最先进序列模型(例如,RNNs、Transformers)和大规模预训练语言模型(例如,BERT)在两个公开数据集上进行。
  • 评估采用标准NLP指标,如F1值、精确率和召回率,以比较不同会话配置下的模型性能。
  • 该框架整合了计算语言学、社会心理学和NLP的洞见,以确保方法论和伦理上的稳健性。

实验结果

研究问题

  • RQ1如何设计一种标准化框架,利用重复行为和权力失衡来建模基于会话的网络欺凌?
  • RQ2在创建可靠基于会话的网络欺凌检测数据集时,关键的数据和方法论挑战是什么?
  • RQ3最先进序列模型和大规模预训练语言模型在基于会话的网络欺凌检测任务中的表现如何?
  • RQ4哪些基于证据的标准可以指导高质量、具有代表性的基于会话的网络欺凌数据集的创建?
  • RQ5基于会话的网络欺凌检测中的主要开放性挑战和未来研究方向是什么?

主要发现

  • 所提出的基于会话的检测框架通过结构化的会话建模,有效捕捉了网络欺凌的时间性和关系性动态。
  • 基准测试显示,大规模预训练语言模型在基于会话的网络欺凌检测任务中通常优于传统序列模型。
  • 该研究发现不同数据集之间存在显著的性能差异,凸显了制定标准化评估协议的必要性。
  • 基于证据的数据集创建准则提高了未来研究中数据的质量、一致性和可复现性。
  • 在处理长会话、检测微妙的权力失衡以及确保模型在多样化社交媒体平台上的泛化能力方面,仍存在关键挑战。
  • 该综述强调了将社会心理学洞见与NLP技术相结合,以构建更稳健检测系统的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。