Skip to main content
QUICK REVIEW

[论文解读] JUNLP@Dravidian-CodeMix-FIRE2020: Sentiment Classification of Code-Mixed Tweets using Bi-Directional RNN and Language Tags

Sainik Kumar Mahata, Dipankar Das|arXiv (Cornell University)|Oct 20, 2020
Sentiment Analysis and Opinion Mining参考文献 9被引用 6
一句话总结

本文提出了一种结合语言标签和FastText词嵌入的双向LSTM模型,用于英语-泰米尔语混合语料的方面情感分类。该系统在FIRE2020共享任务测试集上取得了0.58的F1分数,表明在低资源、混合语种的NLP场景中,语言标签可提升基线模型的性能。

ABSTRACT

Sentiment analysis has been an active area of research in the past two decades and recently, with the advent of social media, there has been an increasing demand for sentiment analysis on social media texts. Since the social media texts are not in one language and are largely code-mixed in nature, the traditional sentiment classification models fail to produce acceptable results. This paper tries to solve this very research problem and uses bi-directional LSTMs along with language tagging, to facilitate sentiment tagging of code-mixed Tamil texts that have been extracted from social media. The presented algorithm, when evaluated on the test data, garnered precision, recall, and F1 scores of 0.59, 0.66, and 0.58 respectively.

研究动机与目标

  • 为解决在德罗彼达语语境(如泰米尔-英语)下的混合语种社交媒体文本情感分类挑战。
  • 提升在低资源、多语言且句法复杂的混合语种数据上的性能,这些数据传统NLP工具难以处理。
  • 评估语言标签作为特征在增强混合语种情感分类模型中的有效性。
  • 开发一种基于双向LSTM和FastText嵌入的鲁棒深度学习模型,用于情感极性检测。
  • 参与并为德罗彼达语-混合语-FIRE2020共享任务中关于混合语种社交媒体内容的情感分析做出贡献。

提出的方法

  • 该模型使用带有字符n-gram(3–6)的FastText嵌入,为混合语种英语-泰米尔文本中的单词生成密集向量表示。
  • 使用基于NLTK的语言检测方法,将每个句子中的单词分别标记为英语或非英语,作为额外的输入特征。
  • 将词向量与语言标签拼接后输入双向LSTM层,以捕捉正向和反向的上下文依赖关系。
  • 将双向LSTM的最终上下文向量通过全连接层,预测五种类别的情感标签:正面、负面、混合情感、非泰米尔语或未知。
  • 使用Adam优化器、稀疏分类交叉熵损失函数、批量大小为32、训练50个周期,并采用10%的验证集划分进行训练。
  • 消融研究对比了带与不带语言标签的模型,以及单向与双向LSTM模型,以分离各特征的贡献。

实验结果

研究问题

  • RQ1将语言标签作为特征整合到模型中,在提升英语-泰米尔混合推文情感分类准确率方面有多有效?
  • RQ2在分类混合语种社交媒体文本情感时,使用双向LSTM相比单向LSTM能带来多大的性能提升?
  • RQ3带有字符n-gram的FastText嵌入在低资源、混合语种NLP任务中,对表征学习的改进程度如何?
  • RQ4在德罗彼达语-混合语共享任务中,所提出的模型与不使用语言标签或双向上下文建模的基线模型相比表现如何?
  • RQ5一种轻量级深度学习架构,且架构复杂度较低,是否能在混合语种情感分类任务中取得具有竞争力的结果?

主要发现

  • 最终模型(使用双向LSTM与语言标签特征)在FIRE2020组织方官方测试集上取得了0.58的F1分数。
  • 该模型的精确率为0.59,召回率为0.66,表明情感预测存在轻微的召回偏倚。
  • 在消融模型中,使用语言标签的双向LSTM在F1分数上优于所有其他模型,证实了其有效性。
  • 不使用语言标签的模型F1分数略低(0.61),表明语言标签确实具有增益价值。
  • 表现最佳的模型在测试集上取得了70.42%的准确率,各类情感标签的精确率与召回率分布均衡。
  • 消融研究证实,语言标签与双向上下文建模共同促进了混合语种情感分类性能的提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。