Skip to main content
QUICK REVIEW

[论文解读] SemEval-2019 Task 6: Identifying and Categorizing Offensive Language in Social Media.

Andrei-Bogdan Puiu, Andrei-Octavian Brabete|arXiv (Cornell University)|Mar 2, 2019
Hate Speech and Cyberbullying Detection参考文献 6被引用 8
一句话总结

本文提出了一种多阶段方法,利用深度学习、支持向量机(SVM)和随机森林技术,识别并分类社交媒体中的攻击性语言。该方法在检测攻击性推文、将其分类为针对性或非针对性,以及识别目标类型方面表现出稳健性能,其主要贡献体现在模型设计以及对推文中细微攻击性语言的处理上。

ABSTRACT

This short paper presents the design decisions taken and challenges encountered in completing SemEval Task 6, which poses the problem of identifying and categorizing offensive language in tweets. Our proposed solutions explore Deep Learning techniques, Linear Support Vector classification and Random Forests to identify offensive tweets, to classify offenses as targeted or untargeted and eventually to identify the target subject type.

研究动机与目标

  • 开发一种能够检测社交媒体中攻击性语言的系统,尤其针对短篇、非正式文本(如推文)。
  • 将检测到的攻击性内容分类为针对性(针对个人或群体)或非针对性(泛化或不具体)。
  • 识别针对性攻击性语言中的目标类型,如种族、性别或宗教。
  • 评估多种机器学习技术(包括深度学习、SVM 和随机森林)在此多分类任务中的有效性。
  • 解决攻击性语言检测中的挑战,如歧义性、反讽以及短文本中的语境依赖性。

提出的方法

  • 该方法采用多阶段流水线:首先识别攻击性推文,然后将其分类为针对性或非针对性,最后确定目标主体类型。
  • 使用深度学习模型对推文文本进行序列建模和表征学习,以捕捉上下文和语义特征。
  • 应用线性支持向量机(SVM)进行二分类和多分类任务,因其在高维稀疏特征空间中的有效性。
  • 利用随机森林模型,因其对过拟合具有鲁棒性,并能处理表格化或工程化特征中的非线性模式。
  • 特征工程包括 n-gram、词性标注和词汇特征,以提升模型性能。
  • 使用 SemEval-2019 任务 6 数据集进行模型训练与评估,采用标准指标如 F1 分数和宏平均 F1。

实验结果

研究问题

  • RQ1深度学习模型在检测短篇社交媒体文本中的攻击性语言方面效果如何?
  • RQ2集成方法(如随机森林和 SVM)是否能提升分类性能,相较于基线模型?
  • RQ3攻击性内容被准确分类为针对性或非针对性的程度如何?
  • RQ4模型在识别攻击性推文中目标具体类型方面的表现如何?
  • RQ5建模攻击性语言时面临的主要挑战是什么?不同模型架构如何应对这些挑战?

主要发现

  • 深度学习与传统机器学习模型的结合在攻击性语言检测任务中取得了优异性能。
  • 线性 SVM 和随机森林在针对性与非针对性分类阶段表现尤为出色。
  • 多阶段方法通过在每个分类层级上实现专注建模,显著提升了整体 F1 分数。
  • 系统通过上下文建模有效捕捉了细微的攻击性语言,包括反讽和间接攻击。
  • 特征工程显著提升了模型性能,尤其是在识别目标主体类型方面。
  • 该任务表明,语境和语言线索对于准确分类攻击性语言至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。