[论文解读] Hate and Offensive Speech Detection in Hindi and Marathi
本论文提出并评估了用于印地语和马拉地语仇恨及冒犯性言论检测的深度学习模型,使用的是HASOC 2021数据集。比较了CNN、LSTM和基于BERT的模型,结果表明在细粒度印地语分类任务中,非训练的FastText词嵌入搭配基础模型优于BERT;而RoBERTa和IndicBERT在二元分类任务中达到了最先进水平。
Sentiment analysis is the most basic NLP task to determine the polarity of text data. There has been a significant amount of work in the area of multilingual text as well. Still hate and offensive speech detection faces a challenge due to inadequate availability of data, especially for Indian languages like Hindi and Marathi. In this work, we consider hate and offensive speech detection in Hindi and Marathi texts. The problem is formulated as a text classification task using the state of the art deep learning approaches. We explore different deep learning architectures like CNN, LSTM, and variations of BERT like multilingual BERT, IndicBERT, and monolingual RoBERTa. The basic models based on CNN and LSTM are augmented with fast text word embeddings. We use the HASOC 2021 Hindi and Marathi hate speech datasets to compare these algorithms. The Marathi dataset consists of binary labels and the Hindi dataset consists of binary as well as more-fine grained labels. We show that the transformer-based models perform the best and even the basic models along with FastText embeddings give a competitive performance. Moreover, with normal hyper-parameter tuning, the basic models perform better than BERT-based models on the fine-grained Hindi dataset.
研究动机与目标
- 为解决印地语和马拉地语等低资源印度语言中仇恨及冒犯性言论检测的标注数据稀缺问题。
- 评估不同深度学习架构(CNN、LSTM、BiLSTM和基于Transformer的模型)在印地语和马拉地语文本上的性能。
- 比较预训练词嵌入(FastText)与随机初始化,以及可训练与不可训练嵌入的有效性。
- 研究在印地语细粒度仇恨言论标注中,分层分类策略与直接多分类策略的优劣。
- 为未来在印度语言低资源NLP研究中提供公开共享的最先进模型。
提出的方法
- 将仇恨及冒犯性言论检测建模为文本分类任务,使用HASOC 2021共享任务数据集中的二元标签和细粒度标签。
- 使用印地语和马拉地语的预训练FastText词嵌入(可训练与不可训练模式),在随机初始化和预训练嵌入下训练一维CNN、LSTM和BiLSTM模型。
- 评估基于Transformer的模型,包括多语言BERT(mBERT)、IndicBERT、RoBERTa-base以及一个针对印地语的RoBERTa变体。
- 对4类印地语任务采用分层分类方法:首先将样本分类为仇恨或非仇恨,然后将仇恨样本进一步分类为HATE、OFFN或PRFN。
- 使用标准指标(包括准确率、宏F1、精确率和召回率)比较不同任务中模型的性能。
- 在Hugging Face上公开分享表现最佳的模型,以确保可复现性并供社区使用。
实验结果
研究问题
- RQ1在印地语和马拉地语的仇恨及冒犯性言论检测中,使用FastText嵌入的传统深度学习模型(CNN、LSTM)与基于Transformer的模型(BERT变体)相比表现如何?
- RQ2在低资源环境下,使用不可训练的FastText嵌入是否能提升性能,相比可训练或随机初始化的嵌入?
- RQ3在印地语细粒度仇恨言论标注中,分层分类方法是否优于直接多分类策略?
- RQ4数据不平衡问题如何影响BERT模型在细粒度分类任务中的性能?
- RQ5在低资源、细粒度仇恨言论检测任务中,CNN和LSTM等基础模型是否能超越BERT模型?
主要发现
- 在马拉地语二元分类任务中,表现最佳的模型是使用不可训练FastText嵌入的BiLSTM,F1得分为0.854。
- 在印地语二元分类任务中,使用不可训练FastText嵌入的BiLSTM达到最高F1得分0.750,优于其他配置。
- 在印地语细粒度4类分类任务中,使用不可训练FastText嵌入的CNN模型F1得分为0.517,略优于基于RoBERTa的分层模型(F1: 0.520)和直接多分类的RoBERTa模型(F1: 0.521)。
- 在马拉地语数据集上,IndicBERT在所有BERT变体中表现最佳,F1得分为0.869。
- 在印地语二元分类任务中,RoBERTa-base优于其他BERT变体,F1得分为0.763。
- 发现BERT模型在细粒度印地语数据集中对类别不平衡更敏感,需通过数据增强才能达到最佳性能,而基础模型对不平衡更具鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。