Skip to main content
QUICK REVIEW

[论文解读] An exploratory experiment on Hindi, Bengali hate-speech detection and transfer learning using neural networks

Tung Minh Phung, Jan Cloos|arXiv (Cornell University)|Jan 6, 2022
Hate Speech and Cyberbullying Detection被引用 4
一句话总结

该论文提出了一种针对印地语和孟加拉语的低资源、计算效率高的仇恨言论检测系统,采用神经网络进行迁移学习。通过微调词嵌入并重用印地语模型的分类器权重,该方法在孟加拉语数据上实现了82.98%的准确率,与从零开始训练的效果相当,证明了在数据有限且无显式翻译监督的情况下,跨语言知识迁移的有效性。

ABSTRACT

This work presents our approach to train a neural network to detect hate-speech texts in Hindi and Bengali. We also explore how transfer learning can be applied to learning these languages, given that they have the same origin and thus, are similar to some extend. Even though the whole experiment was conducted with low computational power, the obtained result is comparable to the results of other, more expensive, models. Furthermore, since the training data in use is relatively small and the two languages are almost entirely unknown to us, this work can be generalized as an effort to demystify lost or alien languages that no human is capable of understanding.

研究动机与目标

  • 开发一种基于神经网络的低计算成本仇恨言论检测模型,适用于印地语和孟加拉语。
  • 探究在标注数据有限的情况下,从印地语到孟加拉语的迁移学习是否能提升性能。
  • 评估印地语与孟加拉语之间共享的语言根源是否能在自然语言处理任务中实现有效的知识迁移。
  • 探索迁移学习是否能通过学习对齐的语义表示,隐式支持词级别的翻译。
  • 比较从零开始训练与使用迁移学习的模型性能,特别是在泛化能力和过拟合方面的差异。

提出的方法

  • 通过移除用户名、标点符号和停用词来预处理原始社交媒体文本,同时保留话题标签,并对英文单词进行大小写归一化。
  • 使用Skip-gram架构训练词嵌入,向量维度为300,上下文窗口大小为10。
  • 在学习到的嵌入表示之上训练一个两层前馈神经网络分类器,用于仇恨言论分类。
  • 应用增强训练技术,包括批量归一化、Dropout和学习率调度,以提升模型泛化能力。
  • 通过使用印地语模型的权重初始化孟加拉语模型权重,实现迁移学习,尤其重用非嵌入层的参数。
  • 通过计算印地语和孟加拉语中翻译后词嵌入之间的余弦相似度,评估词翻译潜力。

实验结果

研究问题

  • RQ1一个在低资源印地语仇恨言论数据上训练的神经网络,能否在孟加拉语上以极低计算成本实现具有竞争力的性能?
  • RQ2与从零开始训练相比,从印地语到孟加拉语的迁移学习是否能提升分类准确率?
  • RQ3尽管数据集规模和标签分布相似,为何基线印地语-印地语模型出现性能下降,而孟加拉语-孟加拉语模型却没有?
  • RQ4在无显式对齐的情况下,印地语与孟加拉语之间的迁移学习能否产生有意义的词级别翻译表示?
  • RQ5当仅重用印地语分类器的非嵌入层参数时,固定权重的迁移学习在孟加拉语任务上的有效性如何?

主要发现

  • 增强后的印地语-印地语模型在测试集上达到80.73%的准确率,相比基线模型提升了约10%,且在第8轮后未出现性能下降。
  • 经过增强训练的孟加拉语-孟加拉语模型准确率达到82.98%,比基线模型高出约4%。
  • 印地语-孟加拉语迁移学习模型达到80.40%的准确率,相比其基线仅提升2%,而基线模型自第6轮起已表现良好(约80%)。
  • 增强模型,特别是印地语-印地语和孟加拉语-孟加拉语变体,表现出更好的泛化能力,且未出现过拟合现象,而其基线模型则存在此问题。
  • 通过余弦相似度未观察到有意义的词对词翻译,表明孟加拉语嵌入层未能收敛到与印地语词等价的表示。
  • 在印地语-孟加拉语模型中固定已迁移的权重(非嵌入层)并未显著提升性能,表明基线模型本身已具备较强性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。