Skip to main content
QUICK REVIEW

[论文解读] Opinion mining of text documents written in Macedonian language

Andrej Gajduk, Ljupčo Kocarev|arXiv (Cornell University)|Nov 17, 2014
Sentiment Analysis and Opinion Mining参考文献 32被引用 4
一句话总结

该论文提出了一种针对马其顿语论坛帖子的机器学习意见挖掘方法,采用词袋频率-逆文档频率(tf-idf)特征与支持向量机(SVM)对情感进行正面、负面或客观的分类。系统整体准确率达到92%,表明自动化意见挖掘在马其顿语文本上可达到人类水平的性能,而分词处理如词干还原和停用词去除因语言特性挑战反而降低了准确率。

ABSTRACT

The ability to extract public opinion from web portals such as review sites, social networks and blogs will enable companies and individuals to form a view, an attitude and make decisions without having to do lengthy and costly researches and surveys. In this paper machine learning techniques are used for determining the polarity of forum posts on kajgana which are written in Macedonian language. The posts are classified as being positive, negative or neutral. We test different feature metrics and classifiers and provide detailed evaluation of their participation in improving the overall performance on a manually generated dataset. By achieving 92% accuracy, we show that the performance of systems for automated opinion mining is comparable to a human evaluator, thus making it a viable option for text data analysis. Finally, we present a few statistics derived from the forum posts using the developed system.

研究动机与目标

  • 开发一种自动化系统,用于将马其顿语论坛帖子中的公众意见分类为正面、负面或客观。
  • 评估不同特征表示方法与分类器在马其顿语情感分类中的有效性。
  • 研究文本预处理技术(如停用词去除与词干还原)在低资源自然语言处理环境下对分类性能的影响。
  • 证明自动化意见挖掘系统可在马其顿语文本上实现与人工评估相当的准确率,从而实现公众情绪的可扩展分析。

提出的方法

  • 使用四种特征度量对文本数据进行表示:n-gram存在性、计数、频率以及频率-逆文档频率(tf-idf)。
  • 研究采用两种分类器:支持向量机(SVM)与朴素贝叶斯(NB),通过10折交叉验证进行评估。
  • 从单字词与双字词构建特征词典,重点聚焦于单字词表示以实现最优性能。
  • 测试基于规则的双字词(如否定与强调模式),以增强对上下文敏感表达的情感检测。
  • 预处理步骤包括停用词过滤与词干还原,但其影响通过实证方法进行评估。
  • 系统首先执行主观性分类,随后对主观性文本进行极性分类(正面/负面)。

实验结果

研究问题

  • RQ1在马其顿语情感分类中,最优的特征表示与分类器组合是什么?
  • RQ2常见的预处理技术(如词干还原与停用词去除)对马其顿语意见挖掘性能有何影响?
  • RQ3双字词(尤其是基于规则的双字词)在多大程度上提升了情感分类准确率?
  • RQ4自动化意见挖掘系统能否在马其顿语文本上实现与人工评估相当的准确率?

主要发现

  • 使用tf-idf特征表示与SVM分类器实现了92%的整体准确率,表现出色,与人工评估水平相当。
  • SVM在所有特征表示下均优于朴素贝叶斯,其中tf-idf表现最佳(主观性分类准确率达94%,极性分类准确率达96%)。
  • 词干还原与停用词去除等预处理步骤反而降低了准确率,可能由于马其顿语词干还原算法性能不佳。
  • 仅使用双字词时表现较差,但将单字词与双字词结合后准确率略有提升,尤其在存在性特征下(SVM最高达79%)。
  • 基于规则的双字词(如否定模式)影响甚微,仅在使用存在性特征时带来轻微提升(SVM从76%提升至78%)。
  • 公众情绪分析显示,食物与时尚类话题引发最积极的情绪,而全球事务与经济类话题则引发最多负面情绪。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。