Skip to main content
QUICK REVIEW

[论文解读] L3CubeMahaSent: A Marathi Tweet-based Sentiment Analysis Dataset

Atharva Kulkarni, Meet Mandhane|arXiv (Cornell University)|Mar 21, 2021
Sentiment Analysis and Opinion Mining参考文献 32被引用 6
一句话总结

本论文提出了 L3CubeMahaSent,这是首个大规模公开可用的基于马拉地语推文的情感分析数据集,包含约16,000条人工标注的推文,分为三类:正面、负面和中性。该研究评估了多种深度学习模型——包括CNN、BiLSTM、ULMFiT、mBERT和IndicBERT,结果表明IndicBERT在三分类任务中表现最佳,准确率达84.13%;而使用可训练Indic fastText嵌入的CNN在二分类任务中表现最优,准确率达93.13%。

ABSTRACT

Sentiment analysis is one of the most fundamental tasks in Natural Language Processing. Popular languages like English, Arabic, Russian, Mandarin, and also Indian languages such as Hindi, Bengali, Tamil have seen a significant amount of work in this area. However, the Marathi language which is the third most popular language in India still lags behind due to the absence of proper datasets. In this paper, we present the first major publicly available Marathi Sentiment Analysis Dataset - L3CubeMahaSent. It is curated using tweets extracted from various Maharashtrian personalities' Twitter accounts. Our dataset consists of ~16,000 distinct tweets classified in three broad classes viz. positive, negative, and neutral. We also present the guidelines using which we annotated the tweets. Finally, we present the statistics of our dataset and baseline classification results using CNN, LSTM, ULMFiT, and BERT-based deep learning models.

研究动机与目标

  • 为解决马拉地语这一低资源印度语言缺乏公开可用的大规模情感分析数据集的问题。
  • 创建一个高质量、人工标注的马拉地语推文数据集,以支持基于深度学习的情感分类研究。
  • 利用最先进的模型(包括CNN、BiLSTM、ULMFiT和BERT变体)建立马拉地语情感分析的基准。
  • 提供可重用的预训练嵌入和微调模型,以加速马拉地语自然语言处理研究。
  • 支持下游自然语言处理任务,如仇恨言论检测、虚假新闻识别和马拉地语政治情感分析。

提出的方法

  • 从马哈拉施特拉邦知名人士的公开Twitter账号中精选约16,000条独特的马拉地语推文。
  • 采用全面的标注策略,将每条推文人工划分为三类情感类别:正面、负面和中性。
  • 将数据集划分为平衡的训练集、验证集和测试集,以支持可复现的实验。
  • 训练并评估多种深度学习架构:CNN、BiLSTM、ULMFiT以及基于Transformer的模型(mBERT、IndicBERT)。
  • 使用多种词嵌入方法:随机初始化、Facebook的fastText以及IndicNLP的fastText嵌入,涵盖可训练和静态两种模式。
  • 利用CLS标记对mBERT和IndicBERT进行微调,用于序列分类,借助迁移学习提升性能。

实验结果

研究问题

  • RQ1在新构建的马拉地语情感分析数据集上,最先进深度学习模型的性能如何?
  • RQ2在马拉地语这类低资源语言上,预训练词嵌入与随机初始化相比,在泛化能力和过拟合方面表现如何?
  • RQ3在马拉地语推文情感分类任务中,CNN、BiLSTM、ULMFiT或BERT哪类架构在二分类和三分类设置下表现最佳?
  • RQ4与单语或通用多语言基线相比,多语言BERT模型(mBERT和IndicBERT)在马拉地语情感分析中的有效性如何?
  • RQ5使用领域特定、语言特定的嵌入(如Indic fastText)在多大程度上提升了马拉地语文本的模型性能?

主要发现

  • IndicBERT在三分类任务中取得了最高的准确率84.13%,优于其他模型,包括mBERT和基于CNN的架构。
  • 使用可训练Indic fastText嵌入的CNN在二分类任务中表现最佳,准确率达93.13%,略高于IndicBERT在此设置下的表现。
  • 来自IndicNLP的预训练词嵌入在马拉地语文本中,无论在可训练还是静态模式下,均优于Facebook的fastText嵌入。
  • 使用预训练嵌入的模型相比随机权重初始化的模型,表现出显著更低的过拟合现象。
  • ULMFiT在三分类任务中也取得了具有竞争力的性能(准确率80.80%),证明了在数据有限情况下迁移学习的有效性。
  • 混淆矩阵显示,模型对正面和负面类别的预测最为一致,而中性类别存在更高的误分类率,尤其是在三分类设置中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。