[论文解读] CUSATNLP@HASOC-Dravidian-CodeMix-FIRE2020:Identifying Offensive Language from ManglishTweets
本文提出了一种基于神经网络的方法,用于识别使用罗马字母书写的马来语-英语混合语(Manglish)推文中的攻击性语言——采用两种嵌入方法(Keras 嵌入和 Doc2Vec)及三种分类器系统。表现最佳的模型为两个分类器的加权集成模型,加权 F1 分数达到 0.54,表明在处理类别不平衡、低资源的混合语攻击性语言检测任务中具有中等有效性。
With the popularity of social media, communications through blogs, Facebook, Twitter, and other plat-forms have increased. Initially, English was the only medium of communication. Fortunately, now we can communicate in any language. It has led to people using English and their own native or mother tongue language in a mixed form. Sometimes, comments in other languages have English transliterated format or other cases; people use the intended language scripts. Identifying sentiments and offensive content from such code mixed tweets is a necessary task in these times. We present a working model submitted for Task2 of the sub-track HASOC Offensive Language Identification- DravidianCodeMix in Forum for Information Retrieval Evaluation, 2020. It is a message level classification task. An embedding model-based classifier identifies offensive and not offensive comments in our approach. We applied this method in the Manglish dataset provided along with the sub-track.
研究动机与目标
- 为解决在混合语社交媒体文本中检测攻击性内容的挑战,特别是针对使用罗马字母书写的马来语混合语(Manglish)。
- 在传统模型可能表现不佳的低资源、多语言环境中,开发一个稳健的攻击性语言分类系统。
- 评估不同嵌入技术——Keras 嵌入和 Doc2Vec——在混合语攻击性语言检测中的有效性。
- 探索结合多个分类器预测结果的集成方法,以提升在类别不平衡数据集上的性能。
- 为达罗毗荼语系混合语社交媒体内容的攻击性语言检测贡献一个可复现的系统,特别针对 FIRE 2020 HASOC 子任务。
提出的方法
- 文本预处理包括使用 tweet-preprocessor 库移除 URL、用户名、话题标签、重复字符、数字,并将所有文本转换为小写。
- 通过两种方法生成句子表示:(1) 使用 one-hot 编码和填充序列的 Keras 嵌入层,生成 50 维向量;(2) 使用 Doc2Vec 从可变长度文本中学习分布式句子表示。
- 实现了三种不同的分类系统:系统 A 使用带有 0.2 循环 dropout 的双向 LSTM 和 sigmoid 输出层;系统 B 使用带有 ReLU 激活函数的三层全连接网络和 sigmoid 输出层。
- 系统 C 通过一个决策函数结合系统 A 和 B 的预测结果:若两个模型对类别判断一致,则采用该结果;否则,当预测概率之和超过 1 时,判定为攻击性类别。
- 所有模型均使用二元交叉熵损失函数进行训练,并通过精确率、召回率和 F1 分数进行评估,采用加权平均 F1 分数以处理类别不平衡问题。
- 在 1,000 条 Manglish 推文的测试集上进行评估,使用 scikit-learn 的 classification_report 函数计算指标。
实验结果
研究问题
- RQ1传统的神经网络架构(如 LSTM 和全连接网络)在检测混合语 Manglish 推文中的攻击性内容方面效果如何?
- RQ2不同的嵌入技术(Keras 嵌入和 Doc2Vec)在低资源、混合语文本中的攻击性语言检测性能上有多大影响?
- RQ3与单一模型相比,多个分类器的集成是否能提升在类别不平衡的混合语数据集上的检测性能?
- RQ4在 FIRE 2020 HASOC 达罗毗荼语系混合语攻击性语言检测任务中,简单非 Transformer 模型的性能如何?
- RQ5在低资源、多语言环境下,精确率、召回率和 F1 分数在攻击性和非攻击性类别上的表现有何差异?
主要发现
- 基于 Keras 嵌入和 LSTM 的系统 A 达到加权 F1 分数 0.53,平均精确率和召回率均为 0.54。
- 使用 Doc2Vec 和深层全连接网络的系统 B 达到较低的加权 F1 分数 0.48,表明在少数类(攻击性)上表现较差(F1=0.40)。
- 系统 C(结合系统 A 和 B 预测结果的集成模型)达到最高的加权 F1 分数 0.54,表明集成方法能够缓解单个模型的弱点。
- 所有系统在微观和宏观 F1 分数上均约为 0.54,表明整体性能一致但中等。
- 模型对“非攻击性”类别的召回率表现更好(系统 A 中为 0.60),但对“攻击性”类别识别困难,尤其在系统 B 中,召回率降至 0.32。
- 尽管使用了先进的嵌入技术,模型仅取得中等性能,表明在混合语达罗毗荼语言的表征学习方面仍有显著提升空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。