Skip to main content
QUICK REVIEW

[论文解读] Bidirectional Recurrent Models for Offensive Tweet Classification

Aleix Cambray, Norbert Podsadowski|arXiv (Cornell University)|Mar 19, 2019
Hate Speech and Cyberbullying Detection参考文献 3被引用 9
一句话总结

本文提出了一种双向循环神经网络架构——主要为双向LSTM和GRU——用于将攻击性推文分为三个子任务:攻击性/非攻击性、针对性/非针对性,以及目标类型(个人/组织/其他)。尽管尝试了更复杂的模型,如CNN和拆分-合并架构,但最简单的双向LSTM在性能上表现最佳,表明在此数据集上,模型复杂度并不一定带来性能提升。

ABSTRACT

In this paper we propose four deep recurrent architectures to tackle the task of offensive tweet detection as well as further classification into targeting and subject of said targeting. Our architectures are based on LSTMs and GRUs, we present a simple bidirectional LSTM as a baseline system and then further increase the complexity of the models by adding convolutional layers and implementing a split-process-merge architecture with LSTM and GRU as processors. Multiple pre-processing techniques were also investigated. The validation F1-score results from each model are presented for the three subtasks as well as the final F1-score performance on the private competition test set. It was found that model complexity did not necessarily yield better results. Our best-performing model was also the simplest, a bidirectional LSTM; closely followed by a two-branch bidirectional LSTM and GRU architecture.

研究动机与目标

  • 开发用于社交媒体(特别是推文)中攻击性语言检测与分类的深度学习模型。
  • 探究模型复杂度的提升是否能改善攻击性推文分类任务的性能。
  • 探索广泛文本预处理对模型泛化能力和性能的影响。
  • 通过加权损失函数缓解攻击性语言数据集中类别不平衡的问题。
  • 评估多种RNN架构(包括biLSTM、biGRU及混合模型)在攻击性内容多级分类任务中的有效性。

提出的方法

  • 将双向LSTM和GRU作为核心序列建模组件,以捕捉推文的上下文语义。
  • 设计了一种拆分-处理-合并架构,结合双向LSTM和GRU分支,以并行方式处理序列并融合表示。
  • 在RNN之前或之后集成卷积层(CNN),以从词嵌入中提取局部n-gram特征。
  • 应用广泛的文本预处理:删除URL、用户提及、HTML实体、井号、标点符号、数字和停用词;全小写转换;非ASCII字符处理;所有格符号展开;以及词长归一化。
  • 使用SymSpell实现快速分词与拼写纠正,编辑距离≤2。
  • 应用类别加权交叉熵损失以缓解类别不平衡问题,尤其在任务B和C中。

实验结果

研究问题

  • RQ1增加模型复杂度(如添加CNN或混合架构)是否能提升攻击性推文分类的性能?
  • RQ2在这一特定自然语言处理任务中,双向RNN(LSTM/GRU)相较于更简单或更复杂的架构效果如何?
  • RQ3激进的文本预处理在低资源攻击性语言检测任务中能在多大程度上提升模型性能?
  • RQ4类别不平衡如何影响模型训练与评估?是否能有效缓解?
  • RQ5在此情境下,像独立双向LSTM这样的简单模型是否能超越更复杂的模型?

主要发现

  • 最简单的模型——独立双向LSTM——在任务A(攻击性/非攻击性)上取得了最高的验证F1分数0.7382,优于更复杂的架构。
  • 双分支双向LSTM与GRU模型(biGRU ⊕ biLSTM)在任务A上取得第二名性能,验证F1分数为0.7285。
  • 模型复杂度并未持续提升性能;例如,CNN-biLSTM模型在任务A上的F1分数仅为0.6346,显著低于基线biLSTM。
  • 在私有测试集上,表现最佳的biLSTM模型取得了F1分数0.77(任务A)、0.64(任务B)和0.52(任务C),表明其在数据有限的情况下仍具有较强的泛化能力。
  • 类别不平衡严重损害了模型性能,尤其在任务B和C中,但通过类别加权损失函数得到了有效缓解,避免了对多数类别的过度预测。
  • F1分数在训练过程中表现出高度不稳定性,常出现振荡,且与准确率或损失的相关性较差,表明模型收敛和超参数调优存在挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。