Skip to main content
QUICK REVIEW

[论文解读] Cyberbullying detection across social media platforms via platform-aware adversarial encoding

Peiling Yi, Arkaitz Zubiaga|arXiv (Cornell University)|Apr 1, 2022
Hate Speech and Cyberbullying Detection被引用 5
一句话总结

该论文提出 XP-CB,一种平台感知的对抗性框架,通过在不同社交媒体平台之间对齐 BERT 和 RoBERTa 的嵌入表示,利用对抗性训练增强跨平台网络欺凌检测。该方法实现了最先进性能,在六种跨平台配置中,使用 BERT 进行零样本迁移时性能提升 9%,使用 RoBERTa 时提升 7%。

ABSTRACT

Despite the increasing interest in cyberbullying detection, existing efforts have largely been limited to experiments on a single platform and their generalisability across different social media platforms have received less attention. We propose XP-CB, a novel cross-platform framework based on Transformers and adversarial learning. XP-CB can enhance a Transformer leveraging unlabelled data from the source and target platforms to come up with a common representation while preventing platform-specific training. To validate our proposed framework, we experiment on cyberbullying datasets from three different platforms through six cross-platform configurations, showing its effectiveness with both BERT and RoBERTa as the underlying Transformer models.

研究动机与目标

  • 解决现有网络欺凌检测模型在不同社交媒体平台之间泛化能力有限的问题。
  • 缓解由于 Twitter、Wikipedia 和 Formspring 等平台间数据分布差异导致的性能下降问题。
  • 开发一种框架,仅使用源平台的标注数据,即可实现从源平台到目标平台的零样本迁移网络欺凌检测模型。
  • 通过对抗性训练和多编码器对齐,增强基于 Transformer 的模型在不同平台间的表征对齐能力。
  • 在具有不同文本长度和语言风格的多样化平台配置中,持续实现性能提升。

提出的方法

  • 采用多 Transformer 编码器对齐策略,将源平台和目标平台的输入映射到共享的潜在表征空间。
  • 使用对抗性判别器区分源平台和目标平台的嵌入表示,迫使目标编码器生成领域不变的表征。
  • 以 ADDA(对抗性判别域自适应)框架作为对抗性域自适应的骨干结构,实现源域与目标域之间的域自适应。
  • 通过对抗性损失微调目标平台编码器,在最小化领域偏移的同时保留对网络欺凌检测有用的语义信息。
  • 在源平台的标注数据上训练共享分类器,并利用对齐后的表征将该分类器应用于目标平台。
  • 以预训练的 BERT 和 RoBERTa 作为基础编码器,在推理阶段应用域自适应,实现零样本部署。

实验结果

研究问题

  • RQ1在某一社交媒体平台上训练的单一网络欺凌检测模型,能否在无任何目标平台标注数据的情况下,有效泛化到其他平台?
  • RQ2对抗性域自适应在缓解平台特有的语言和结构差异导致的性能下降方面效果如何?
  • RQ3与原始的 BERT 和 RoBERTa 模型相比,XP-CB 框架在多大程度上提升了跨平台迁移能力?
  • RQ4该框架在文本长度差异显著的平台之间(如短文本的 Twitter 与长文本的 Wikipedia)是否仍能保持性能?
  • RQ5在跨平台设置下,XP-CB 学习到的表征在视觉和语义层面与标准 Transformer 模型相比有何差异?

主要发现

  • 在从 Formspring 到 Twitter 的迁移任务中,XP-CB 相较于原始 BERT 的 F1 分数绝对提升了 9%,在相同设置下相较 RoBERTa 提升了 7%。
  • 在全部六个跨平台配置中,平均 F1 分数从 A&A 模型的 0.235 提升至 XP-CB(使用 RoBERTa)的 0.693,表明其具备强大的泛化能力。
  • t-SNE 可视化显示,与标准 BERT 相比,XP-CB 的嵌入表示展现出更清晰的类别分离和更小的领域偏移,表明其表征对齐效果更优。
  • 从 Formspring 到 Wikipedia(长文本)的迁移性能高于从 Twitter 到其他平台(短文本)的迁移,表明文本长度影响迁移能力。
  • 在全部六个跨平台配置中,XP-CB 均显著优于 A&A 基线模型以及标准 BERT/RoBERTa 模型,验证了其鲁棒性。
  • 即使在从 Twitter(短文本)到 Formspring 或 Wikipedia 的迁移任务中,该框架仍保持强劲性能,表明其对数据分布偏移具有高度鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。