Skip to main content
QUICK REVIEW

[论文解读] Sentiment Analysis for YouTube Comments in Roman Urdu

Tooba Tehreem|arXiv (Cornell University)|Feb 19, 2021
Sentiment Analysis and Opinion Mining参考文献 23被引用 4
一句话总结

本研究提出了一种用于罗马乌尔都语YouTube评论的监督情感分析框架,采用五种机器学习模型。该研究应用词袋特征提取方法,并在14,131个样本的数据集上评估分类器,发现SVM的准确率最高,达到64%,优于朴素贝叶斯、线性回归、K近邻(KNN)和多层感知机(MLP)。

ABSTRACT

Sentiment analysis is a vast area in the Machine learning domain. A lot of work is done on datasets and their analysis of the English Language. In Pakistan, a huge amount of data is in roman Urdu language, it is scattered all over the social sites including Twitter, YouTube, Facebook and similar applications. In this study the focus domain of dataset gathering is YouTube comments. The Dataset contains the comments of people over different Pakistani dramas and TV shows. The Dataset contains multi-class classification that is grouped The comments into positive, negative and neutral sentiment. In this Study comparative analysis is done for five supervised learning Algorithms including linear regression, SVM, KNN, Multi layer Perceptron and Naïve Bayes classifier. Accuracy, recall, precision and F-measure are used for measuring performance. Results show that accuracy of SVM is 64 percent, which is better than the rest of the list.

研究动机与目标

  • 实现对巴基斯坦广泛使用的非正式书写系统——罗马乌尔都语用户评论的自动化情感分类。
  • 解决罗马乌尔都语这一低资源语言变体在情感分析领域标注数据集和模型稀缺的问题。
  • 比较五种监督学习算法(朴素贝叶斯、线性回归、SVM、K近邻(KNN)和多层感知机(MLP))在多类别(正面、负面、中性)罗马乌尔都语评论数据集上的性能表现。
  • 通过10折交叉验证,使用标准指标(准确率、精确率、召回率和F1分数)评估模型性能。
  • 为未来在南亚语言中针对低资源、特定书写系统的情感分析研究提供基线参考。

提出的方法

  • 从Kaggle平台收集了14,131条罗马乌尔都语YouTube评论的标注数据集,情感标签(正面、负面、中性)由人工手动分配。
  • 文本预处理包括去除空值,并将评论分词为单词特征以进行向量化表示。
  • 采用词袋(BoW)技术从文本语料中提取最频繁的3,000个特征。
  • 使用10折交叉验证将数据集划分为90%的训练集和10%的测试集,以确保评估的稳健性。
  • 训练并评估了五种监督分类器:朴素贝叶斯、线性回归、SVM、K近邻(KNN)和多层感知机(MLP)。
  • 性能通过混淆矩阵和标准指标(准确率、精确率、召回率和F1分数)进行衡量,结果取10次运行的平均值。

实验结果

研究问题

  • RQ1在罗马乌尔都语YouTube评论的情感分类任务中,哪种监督机器学习算法表现最佳?
  • RQ2传统分类器(如SVM、朴素贝叶斯)与神经网络(如MLP)在低资源罗马乌尔都语文本上的性能表现如何比较?
  • RQ3特征选择(采用3,000个特征的词袋方法)对非正式罗马乌尔都语情感分析模型准确率有何影响?
  • RQ4数据集中的情感分布是否均衡?类别不平衡是否影响了模型的泛化能力?
  • RQ5对于像罗马乌尔都语这样标注数据有限的低资源语言,多类别情感分类模型能否实现可接受的性能?

主要发现

  • SVM在测试集上取得了64%的最高准确率,在所有对比模型中表现最优。
  • 朴素贝叶斯表现中等,准确率低于60%,表明其在处理罗马乌尔都语语言复杂性方面存在局限。
  • 线性回归表现较差,准确率显著低于SVM和KNN,表明其不适用于此类多类别自然语言处理任务。
  • KNN和MLP表现相近,均优于线性回归但逊于SVM,F1分数约为0.55–0.58。
  • 数据集存在类别不平衡,其中48%为中性,29%为正面,24%为负面,这可能影响了模型的偏差和泛化能力。
  • 尽管整体准确率较低,SVM在所有评估指标中表现出最稳定的性能,尤其在正面和中性类别上的召回率和F1分数表现最佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。