Skip to main content
QUICK REVIEW

[论文解读] RiTUAL-UH at TRAC 2018 Shared Task: Aggression Identification

Niloofar Safi Samghabadi, Deepthi Mave|arXiv (Cornell University)|Jul 31, 2018
Hate Speech and Cyberbullying Detection参考文献 14被引用 16
一句话总结

本论文提出了一套系统,用于使用词汇和语义特征对英语和印地语社交媒体文本中的攻击性水平——非攻击性、明显攻击性和隐蔽攻击性——进行分类。在英语中,TF-IDF加权n-gram、词嵌入、情感分析和LIWC特征的组合在Facebook数据集上取得了0.5921的F1分数,在社交媒体数据集上取得了0.5663的F1分数;在印地语中,仅使用词汇特征(n-gram、TF-IDF)的表现优于其他方法,在Facebook数据集上达到0.6292的F1分数(第一名),在社交媒体数据集上达到0.4853的F1分数(第二名)。

ABSTRACT

This paper presents our system for "TRAC 2018 Shared Task on Aggression Identification". Our best systems for the English dataset use a combination of lexical and semantic features. However, for Hindi data using only lexical features gave us the best results. We obtained weighted F1- measures of 0.5921 for the English Facebook task (ranked 12th), 0.5663 for the English Social Media task (ranked 6th), 0.6292 for the Hindi Facebook task (ranked 1st), and 0.4853 for the Hindi Social Media task (ranked 2nd).

研究动机与目标

  • 开发一种针对多语言社交媒体内容的稳健攻击性识别系统,重点关注英语和印地语。
  • 解决在嘈杂、非正式的在线文本中区分明显攻击性、隐蔽攻击性和非攻击性评论的挑战。
  • 评估不同特征类型(词汇、语义、情感、词典基础)在不同语言和平台设置下的有效性。
  • 探究为何在印地语中词汇特征优于语义和情感特征,尽管在英语中这些特征表现良好。
  • 通过分析误分类样本中的特征重要性和混淆模式,提升分类性能。

提出的方法

  • 对一元组、二元组、三元组、字符n-gram(3–5)以及跳字n-gram(k=2, n=2,3)应用TF-IDF加权,以提取词汇特征。
  • 对英语使用预训练的Google News词嵌入(300维),对每条评论的词向量取平均,覆盖率达63%。
  • 使用Stanford情感分析工具提取每条评论的情感分布的均值和标准差。
  • 使用LIWC2007提取与积极/消极情绪及自我指涉相关类别中词汇的归一化计数。
  • 使用自研的基于CRF的语言识别系统(F1加权得分97%)处理中英混杂的印地语-英语数据。
  • 使用indic-trans工具将德维纳加里文字的印地语文本转写为罗马字母,以实现一致处理。

实验结果

研究问题

  • RQ1不同组合的词汇、语义、情感和词典基础特征如何影响英语和印地语中的攻击性分类性能?
  • RQ2为何在印地语数据中,仅使用词汇特征的模型优于包含语义和情感特征的混合模型,尽管在英语中这些特征表现良好?
  • RQ3识别隐蔽攻击性评论时,最具区分力的特征是什么,尤其是在缺乏明显粗俗用语的情况下?
  • RQ4训练集和测试集中标签分布的不平衡如何影响模型的泛化能力和性能?
  • RQ5中英混杂和多语言样本在英语与印地语攻击性检测性能差距中扮演了何种角色?

主要发现

  • 在英语Facebook任务中,系统取得了加权F1分数0.5921,在20支队伍中排名第12位。
  • 在英语社交媒体任务中,系统取得了加权F1分数0.5663,在20支队伍中排名第6位。
  • 在印地语Facebook任务中,系统取得了加权F1分数0.6292,在19支队伍中荣获第一名。
  • 在印地语社交媒体任务中,系统取得了加权F1分数0.4853,在19支队伍中排名第二。
  • 混淆矩阵显示,模型经常将非攻击性(NAG)样本误分类为隐蔽攻击性(CAG),尤其是在英语中,这是由于CAG样本中粗俗用语使用率较低。
  • 在印地语中,CAG的最显著特征是粗俗词汇和攻击性词语的字符三元组,而NAG样本则以中性英语词汇为主导,表明各类别之间存在明显的特征分离。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。