Skip to main content
QUICK REVIEW

[论文解读] Comparison of Classical Machine Learning Approaches on Bangla Textual Emotion Analysis

Md. Ataur Rahman, Md. Hanif Seddiqui|arXiv (Cornell University)|Jul 18, 2019
Sentiment Analysis and Opinion Mining参考文献 5被引用 14
一句话总结

本文提出了一种基于人工标注语料库的细粒度孟加拉语文本情感分析系统,采用经典机器学习模型。该语料库包含6,314条Facebook评论。表现最佳的模型为使用unigram和TF-IDF特征的非线性SVM(RBF核),其准确率为52.98%,宏F1值为0.3324,显著优于基线模型。

ABSTRACT

Detecting emotions from text is an extension of simple sentiment polarity detection. Instead of considering only positive or negative sentiments, emotions are conveyed using more tangible manner; thus, they can be expressed as many shades of gray. This paper manifests the results of our experimentation for fine-grained emotion analysis on Bangla text. We gathered and annotated a text corpus consisting of user comments from several Facebook groups regarding socio-economic and political issues, and we made efforts to extract the basic emotions (sadness, happiness, disgust, surprise, fear, anger) conveyed through these comments. Finally, we compared the results of the five most popular classical machine learning techniques namely Naive Bayes, Decision Tree, k-Nearest Neighbor (k-NN), Support Vector Machine (SVM) and K-Means Clustering with several combinations of features. Our best model (SVM with a non-linear radial-basis function (RBF) kernel) achieved an overall average accuracy score of 52.98% and an F1 score (macro) of 0.3324

研究动机与目标

  • 开发并标注一个高质量、平衡的孟加拉语情感语料库,用于细粒度情感分类。
  • 评估经典机器学习模型在孟加拉语文本上的表现,以检测六种基本情绪:悲伤、快乐、厌恶、惊讶、恐惧和愤怒。
  • 在多种特征组合下,比较五种经典分类器(朴素贝叶斯、决策树、k-NN、SVM和K-均值聚类)的性能。
  • 识别低资源孟加拉语文本情感分类的最优特征集与超参数配置。
  • 为未来基于经典机器学习方法的孟加拉语情感分析研究建立基准。

提出的方法

  • 从讨论社会政治议题的Facebook群组中收集并人工标注了6,314条孟加拉语社交媒体评论。
  • 使用POS标注(Bengali Dandapat et al. 2009)、停用词去除和归一化处理对文本进行预处理,以应对形态变化。
  • 提取多种特征集:unigram、n-gram(1–3)、TF-IDF和POS标签,使用scikit-learn的特征提取管道。
  • 训练并评估五种经典分类器:朴素贝叶斯、决策树、k-NN、SVM(线性和非线性RBF)以及K-均值聚类。
  • 通过在C(1.0–3.0)和gamma(0.1–1.0)值上进行网格搜索,对SVM的超参数进行优化,最终选择RBF核为最优。
  • 使用准确率、宏F1值和微F1值以及混淆矩阵评估模型,以分析各类别的性能表现及误分类模式。

实验结果

研究问题

  • RQ1在六种情绪类别下,哪种经典机器学习模型在细粒度孟加拉语情感分类中表现最佳?
  • RQ2不同特征组合(如unigram、TF-IDF、n-gram、POS标签)如何影响孟加拉语文本情感分类器的性能?
  • RQ3在此情境下,SVM模型使用RBF核的最优超参数配置是什么?
  • RQ4无监督的K-均值聚类在孟加拉语情感分类中的表现与有监督模型相比如何?
  • RQ5引入POS标签和停用词过滤在多大程度上提升了分类性能?

主要发现

  • 使用非线性RBF核的SVM在准确率(52.98%)和宏F1值(0.3324)上均达到最高,优于所有其他模型。
  • SVM模型的最佳特征组合为unigram与TF-IDF加权,该组合在所有指标上均表现最优。
  • 最佳模型的微F1值为0.476,表明在所有情绪类别中整体分类一致性中等。
  • K-均值聚类表现较差,最大V-measure为0.049,调整兰德指数为0.059,表明聚类质量较弱。
  • 决策树模型在使用unigram和TF-IDF特征时达到第二高的准确率(44.2%),但F1值显著低于SVM。
  • 该模型在“快乐”(F1: 0.742)和“愤怒”(F1: 0.565)类别上表现良好,但在“厌恶”和“恐惧”类别上表现较差(F1 < 0.05),表明存在类别不平衡或语义模糊问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。