Skip to main content
QUICK REVIEW

[论文解读] "Hinglish" Language -- Modeling a Messy Code-Mixed Language

Vivek Kumar Gupta|arXiv (Cornell University)|Dec 30, 2019
Hate Speech and Cyberbullying Detection参考文献 1被引用 5
一句话总结

本文提出一种结合数据增强的双向LSTM模型,用于将印地语-英语混合的社交媒体内容分类为辱骂性、仇恨煽动性或非攻击性类别。通过在合成文本上应用同义词替换、随机插入、随机替换和删除等数据增强技术,该模型实现了最先进性能,优于先前的混合CNN-LSTM方法,在仇恨言论检测中达到77%的召回率,在攻击性内容分类中达到92%的精确率。

ABSTRACT

With a sharp rise in fluency and users of "Hinglish" in linguistically diverse country, India, it has increasingly become important to analyze social content written in this language in platforms such as Twitter, Reddit, Facebook. This project focuses on using deep learning techniques to tackle a classification problem in categorizing social content written in Hindi-English into Abusive, Hate-Inducing and Not offensive categories. We utilize bi-directional sequence models with easy text augmentation techniques such as synonym replacement, random insertion, random swap, and random deletion to produce a state of the art classifier that outperforms the previous work done on analyzing this dataset.

研究动机与目标

  • 为解决在印地语-英语混合语言(一种广泛用于印度社交媒体的代码混用语言)中识别攻击性和仇恨煽动性内容的挑战。
  • 通过在合成文本数据上应用数据增强技术,克服小样本、类别不平衡数据集的局限性。
  • 开发一种深度学习模型,以捕捉嘈杂且语言多变的印地语-英语混合文本中的长期依赖关系。
  • 在HEOT数据集上,超越先前最先进混合CNN-LSTM模型的分类性能。

提出的方法

  • 采用双向LSTM网络建模印地语-英语文本中的序列依赖关系,同时捕捉前向和后向上下文信息。
  • 应用四种文本增强技术——同义词替换、随机插入、随机替换和随机删除——以增加训练数据的多样性与规模。
  • 使用预训练的100维GloVe词嵌入,并在印地语-英语数据集上进行微调,以提升表征学习效果。
  • 通过优化学习率(0.01)、序列长度(200)和32个双向LSTM单元的超参数,实现性能与过拟合之间的平衡。
  • 通过迁移学习策略,使用预训练的GloVe权重初始化嵌入,并在印地语-英语数据上进行微调。
  • 在建模前,通过移除URL、用户名、话题标签、标点符号和停用词对原始推文进行预处理,以减少噪声。

实验结果

研究问题

  • RQ1数据增强技术能否提升在低资源、代码混用的印地语-英语文本分类任务中深度学习模型的性能?
  • RQ2在印地语-英语文本中分类攻击性和仇恨言论时,不同序列建模架构(如GRU、LSTM和双向LSTM)的表现如何比较?
  • RQ3在印地语-英语数据上对预训练词嵌入(如GloVe)进行微调,与使用固定嵌入相比,能否显著提升分类准确率?
  • RQ4在标注数据有限的情况下,从英语数据集迁移学习是否能提升印地语-英语仇恨语言检测的性能?
  • RQ5当前模型在检测印地语-英语仇恨言论方面存在哪些主要局限性,应如何解决?

主要发现

  • 采用32个单元和0.2循环丢弃率的双向LSTM在仇恨言论检测中实现了最高的召回率(77%),优于其他RNN变体。
  • 基于GRU的模型在攻击性内容分类中实现了最高的精确率(92%),表明其在减少误报方面表现优异。
  • 采用数据增强的模型优于先前最先进混合CNN-LSTM模型,证明了在低资源环境下合成数据的有效性。
  • 在印地语-英语数据上对预训练GloVe嵌入进行微调,相比使用固定嵌入,性能更优,凸显了领域特定表征学习的价值。
  • 尽管在非攻击性和攻击性类别上表现良好,仇恨言论检测的召回率仍低于80%,表明仍需提升泛化能力。
  • 错误分析显示,模型在罕见或高度变异的语言形式上表现不佳,提示需要更大、更丰富的印地语-英语语料库以提升鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。