[论文解读] Sentiment Analysis of Code-Mixed Social Media Text (Hinglish)
本文针对Hinglish(印地语-英语混合)推文文本的方面分析进行了全面研究,采用多种自然语言处理技术。研究应用了迭代式数据清洗、多种特征提取方法(TF-IDF、词嵌入)以及多样化的机器学习模型,在SemEval-2020 Task 9数据集上,通过集成投票分类器实现了最高的F1得分69.07。
This paper discusses the results obtained for different techniques applied for performing the sentiment analysis of social media (Twitter) code-mixed text written in Hinglish. The various stages involved in performing the sentiment analysis were data consolidation, data cleaning, data transformation and modelling. Various data cleaning techniques were applied, data was cleaned in five iterations and the results of experiments conducted were noted after each iteration. Data was transformed using count vectorizer, one hot vectorizer, tf-idf vectorizer, doc2vec, word2vec and fasttext embeddings. The models were created using various machine learning algorithms such as SVM, KNN, Decision Trees, Random Forests, Naive Bayes, Logistic Regression, and ensemble voting classifiers. The data was obtained from a task on Codalab competition website which was listed as Task:9 on the Semeval-2020 competition website. The models created were evaluated using the F1-score (macro). The best F1-score of 69.07 was achieved using ensemble voting classifier.
研究动机与目标
- 为解决低资源、代码混合社交媒体文本中的情感分析挑战,特别是Hinglish(印地语-英语混合)内容的情感分析问题。
- 评估不同数据预处理、特征工程和机器学习技术在代码混合文本上的有效性。
- 识别在Hinglish文本情感分类中,预处理、特征提取和建模方法的最佳组合。
- 为多语言、非正式社交媒体文本的情感分析提供可复现的处理流程。
提出的方法
- 数据来自Codalab平台上的SemEval-2020 Task 9竞赛,聚焦于Hinglish推文内容。
- 采用五阶段迭代式数据清洗流程,以提升文本质量和一致性。
- 特征表示方法包括词袋计数向量化器、独热编码、TF-IDF以及词嵌入(Word2Vec、FastText、Doc2Vec)。
- 训练了多种机器学习模型,包括SVM、KNN、决策树、随机森林、朴素贝叶斯、逻辑回归以及集成投票分类器。
- 使用宏平均F1得分对模型进行评估,以应对情感标签中的类别不平衡问题。
- 集成投票分类器结合多个基模型的预测结果,以提升整体性能。
实验结果
研究问题
- RQ1哪种数据清洗策略能为Hinglish文本的情感分类性能带来最显著的提升?
- RQ2不同特征表示技术(如TF-IDF与词嵌入)对代码混合文本模型准确率有何影响?
- RQ3在Hinglish社交媒体内容的情感分类中,哪种机器学习算法表现最佳?
- RQ4在低资源、代码混合的NLP场景下,集成方法是否能超越单一模型?
- RQ5在Hinglish情感分析中,预处理、特征提取与建模的最佳组合流程是什么?
主要发现
- 迭代式数据清洗流程显著提升了模型性能,五轮清洗后达到最佳效果。
- 集成投票分类器实现了最高的F1得分69.07,优于所有单一模型。
- TF-IDF和基于词嵌入的特征(尤其是FastText)表现优异,部分配置下TF-IDF略胜一筹。
- 在单一模型中,随机森林和SVM的F1得分相对较高,但仍不及集成方法。
- 研究证实,通过投票机制结合多个模型是提升代码混合、低资源文本情感分类性能的有效策略。
- 结果表明,对非正式、多语言社交媒体文本而言,精心设计的预处理和特征工程对实现高性能至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。