Skip to main content
QUICK REVIEW

[论文解读] Code-Mixed Sentiment Analysis Using Machine Learning and Neural Network Approaches

Pruthwik Mishra, Prathyusha Danda|arXiv (Cornell University)|Aug 9, 2018
Natural Language Processing Techniques参考文献 11被引用 12
一句话总结

本论文提出了一种基于机器学习与神经网络的方法,用于印度语言对(印地语-英语和孟加拉语-印地语-英语)的混合编码情感分析,采用TF-IDF字符n-gram(n=2至6)与线性SVM及集成投票分类器结合。线性SVM模型(Run2)表现最佳,在SAIL-Code Mixed工具竞赛中以F-scores 0.569(Hi-En)和0.526(Ben-Hi-En)获得第一名。

ABSTRACT

Sentiment Analysis for Indian Languages (SAIL)-Code Mixed tools contest aimed at identifying the sentence level sentiment polarity of the code-mixed dataset of Indian languages pairs (Hi-En, Ben-Hi-En). Hi-En dataset is henceforth referred to as HI-EN and Ben-Hi-En dataset as BN-EN respectively. For this, we submitted four models for sentiment analysis of code-mixed HI-EN and BN-EN datasets. The first model was an ensemble voting classifier consisting of three classifiers - linear SVM, logistic regression and random forests while the second one was a linear SVM. Both the models used TF-IDF feature vectors of character n-grams where n ranged from 2 to 6. We used scikit-learn (sklearn) machine learning library for implementing both the approaches. Run1 was obtained from the voting classifier and Run2 used the linear SVM model for producing the results. Out of the four submitted outputs Run2 outperformed Run1 in both the datasets. We finished first in the contest for both HI-EN with an F-score of 0.569 and BN-EN with an F-score of 0.526.

研究动机与目标

  • 为解决混合编码印度语言文本中的情感分析挑战,特别是印地语-英语(Hi-En)和孟加拉语-印地语-英语(Ben-Hi-En)语言对的问题。
  • 开发稳健的机器学习与神经网络模型,能够准确分类低资源、混合语言文本中的句子级情感极性。
  • 参与并在此类混合编码情感分析竞赛中取得顶尖表现。
  • 比较在此低资源、多语言环境下,集成投票分类器与独立线性SVM模型的有效性。

提出的方法

  • 使用n从2到6的字符n-gram的TF-IDF向量进行特征提取,以捕捉子词语言模式。
  • 实现一个结合线性SVM、逻辑回归与随机森林的投票集成分类器,以提升泛化能力。
  • 使用独立的线性SVM模型作为基线和替代比较方法。
  • 使用scikit-learn(sklearn)库在SAIL-Code Mixed数据集上进行模型训练与评估。
  • 提交四个模型输出,其中Run1(集成模型)与Run2(线性SVM)用于性能对比。
  • 基于SAIL-Code Mixed工具竞赛中Hi-En与Ben-Hi-En数据集的F-score进行评估。

实验结果

研究问题

  • RQ1线性SVM模型结合TF-IDF字符n-gram在混合编码印地语-英语文本的情感分类中效果如何?
  • RQ2在低资源语言对的混合编码情感分析中,多样化分类器的集成能否超越单个模型?
  • RQ3在此特定混合编码情感分析任务中,机器学习模型与神经网络方法的相对表现如何?
  • RQ4TF-IDF字符n-gram与其他特征表示方法相比,在捕捉混合编码印度语言情感方面表现如何?
  • RQ5仅使用传统机器学习方法,可在SAIL-Code Mixed数据集中实现怎样的性能水平?

主要发现

  • 线性SVM模型(Run2)在Hi-En与Ben-Hi-En数据集上均优于集成投票分类器(Run1)。
  • 线性SVM在Hi-En数据集上取得F-score 0.569,成为SAIL-Code Mixed工具竞赛第一名。
  • 线性SVM在Ben-Hi-En数据集上取得F-score 0.526,同样在竞赛中排名第一。
  • 集成模型(Run1)表现低于独立线性SVM,表明在此情境下模型复杂度并未提升结果。
  • TF-IDF字符n-gram(n=2至6)在捕捉混合编码文本中的情感相关模式方面表现有效。
  • 结果表明,通过适当特征工程的传统机器学习模型可在低资源混合编码情感分析任务中实现最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。