Skip to main content
QUICK REVIEW

[论文解读] An Empirical Study on Sentiment Classification of Chinese Review using Word Embedding

Yiou Lin, Hang Lei|arXiv (Cornell University)|Nov 5, 2015
Sentiment Analysis and Opinion Mining参考文献 31被引用 21
一句话总结

本文提出了一项基于一百万条酒店评论语料训练的中文情感分类实证研究,采用词嵌入作为特征。研究评估了多种模型——SVM、逻辑回归、CNN及集成方法,结果表明,通过堆叠表现最佳分类器构建的堆叠集成模型(LR_all)在情感分类任务中取得0.920的F1分数,优于传统的n-gram模型(如朴素贝叶斯和最大熵模型)。

ABSTRACT

In this article, how word embeddings can be used as features in Chinese sentiment classification is presented. Firstly, a Chinese opinion corpus is built with a million comments from hotel review websites. Then the word embeddings which represent each comment are used as input in different machine learning methods for sentiment classification, including SVM, Logistic Regression, Convolutional Neural Network (CNN) and ensemble methods. These methods get better performance compared with N-gram models using Naive Bayes (NB) and Maximum Entropy (ME). Finally, a combination of machine learning methods is proposed which presents an outstanding performance in precision, recall and F1 score. After selecting the most useful methods to construct the combinational model and testing over the corpus, the final F1 score is 0.920.

研究动机与目标

  • 探究词嵌入作为中文情感分类特征的有效性。
  • 比较基于词嵌入的机器学习与深度学习模型与传统n-gram模型(如朴素贝叶斯和最大熵模型)在中文情感分类中的性能表现。
  • 构建并评估一种结合多个分类器的集成模型,以提升中文评论情感分析的性能。
  • 确定在使用词嵌入进行中文情感分类时,实现稳定性能所需的最小数据量。
  • 探究模型架构与特征表示在低资源自然语言处理场景下对情感分类准确率的影响。

提出的方法

  • 构建了一个大规模中文意见语料库MioChnCorp,包含来自在线评论网站的一百万条酒店评论。
  • 使用Word2vec在中文评论领域训练密集向量表示(即词嵌入),采用60维向量。
  • 使用词嵌入作为输入特征,训练多种机器学习模型——SVM、逻辑回归、CNN及集成方法。
  • 通过堆叠多个基模型(ME、SVC、LinearSVC、RF、CNN)的预测结果,构建集成模型(LR_all),并使用Weka的CfsSubsetEval与BestFirst搜索进行特征选择。
  • 最终模型采用逻辑回归,将通过10折交叉验证和属性评估选出的最具信息量的子模型预测结果进行融合。
  • 在不同训练集规模(60,000、80,000、120,000条评论)下,使用精确率、召回率和F1分数评估模型性能。

实验结果

研究问题

  • RQ1在大规模中文评论语料上预训练的词嵌入能否有效表征与情感相关语义,用于情感分类?
  • RQ2使用词嵌入的机器学习模型在中文情感分类中,与传统n-gram模型(如朴素贝叶斯和最大熵模型)相比,性能如何?
  • RQ3在集成框架中,何种模型组合可使中文情感分类的F1分数达到最优?
  • RQ4训练数据规模如何影响基于词嵌入的中文评论情感分类器的性能?
  • RQ5尽管在其他NLP任务中表现优异,为何CNN在本任务中表现不如SVM和集成模型?

主要发现

  • 集成模型LR_all(结合ME、SVC、LinearSVC、RF与CNN的预测)在120,000条评论的测试集上取得最高F1分数0.920。
  • SVM(尤其是LinearSVC与线性核SVC)在所有数据规模下均持续优于其他模型,表现出最佳个体性能。
  • 仅使用词嵌入而无需情感词典即可获得优异结果,表明其在捕捉语义与句法模式方面对情感分类具有高度有效性。
  • CNN模型优于朴素贝叶斯与最大熵模型,但相较于SVM与集成模型仍表现欠佳,可能由于训练数据不足及模型架构对任务不甚优化。
  • 随着训练数据增加,模型性能持续提升,约在60,000条评论时趋于稳定,120,000条评论足以实现最优结果。
  • 属性选择识别出ME、SVC、LinearSVC、RF与CNN为最具价值的模型;移除表现较差的模型(如Vote_all)可提升泛化能力与计算效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。