QUICK REVIEW
[论文解读] Sentiment Analysis: A Survey
Rahul Tejwani|arXiv (Cornell University)|May 11, 2014
Sentiment Analysis and Opinion Mining参考文献 5被引用 15
一句话总结
本综述全面概述了情感分析技术,重点介绍自然语言处理方法在用户生成内容(如产品评论和社交媒体)中分类观点的应用。研究涵盖基于监督学习和无监督学习、词典和主观性检测的文档级、句子级及基于特征的情感分类,最先进的系统准确率最高可达80%。
ABSTRACT
Sentiment analysis (also known as opinion mining) refers to the use of natural language processing, text analysis and computational linguistics to identify and extract subjective information in source materials. Mining opinions expressed in the user generated content is a challenging yet practically very useful problem. This survey would cover various approaches and methodology used in Sentiment Analysis and Opinion Mining in general. The focus would be on Internet text like, Product review, tweets and other social media.
研究动机与目标
- 为用户生成内容(尤其是社交媒体和电子商务领域)的情感分析方法提供系统性综述。
- 识别情感分析中的关键挑战,包括讽刺、否定和非正式文本中的多观点表达。
- 评估不同方法(词典法、机器学习法和主观性分类)在文档级、句子级和特征级情感分类中的有效性。
- 突出情感分析在商业智能、客户反馈分析和社会媒体监控中的实际应用。
- 评估现有研究的局限性,特别是除英语和中文外的多语言支持不足问题。
提出的方法
- 在三个层次上分类情感:文档级(整体极性)、句子级(单一句子的情感)和基于特征的(对特定产品属性的观点)。
- 采用朴素贝叶斯、支持向量机和最大熵等监督学习模型,利用词频、词性标注、观点词和否定词等特征进行情感分类。
- 使用点互信息等无监督方法识别主观词汇,并从无标签文本中提取情感。
- 利用SentiWordNet 3.0、LIWC和General Inquirer等词典资源为词语和短语分配情感得分。
- 应用主观性分类以过滤掉客观句子,仅对富含观点的内容进行情感分析。
- 使用Cornell电影评论数据集、多领域情感(MDS)数据集和MPQA等基准数据集进行模型训练与评估。
实验结果
研究问题
- RQ1如何在非正式且多样的文本来源中准确实现文档级、句子级和特征级的情感分类?
- RQ2在用户生成内容中,哪些特征和机器学习技术在情感分类方面最为有效?
- RQ3否定、讽刺和多观点句子等挑战如何影响情感分析的性能?
- RQ4无监督方法和基于词典的方法在情感分析中能在多大程度上达到与监督模型相当的准确率?
- RQ5情感分析在商业智能和社会媒体监控中的实际应用与局限性是什么?
主要发现
- 监督学习方法(如朴素贝叶斯、支持向量机和最大熵)在标准情感分析数据集上准确率最高可达80%。
- 基于词典和词典的方法(包括SentiWordNet和LIWC)表现良好,部分方法在基准数据集上的准确率超过70%。
- 主观性分类对于过滤无关的客观内容至关重要,可减少处理开销并提高情感分析效率。
- 基于特征的情感分类可实现对特定产品属性(如笔记本电脑屏幕质量)观点的细粒度分析。
- MDS数据集(每个领域包含1000条正面和1000条负面评论,涵盖书籍、DVD、电子产品和厨房电器)被广泛用于情感分析模型的训练与测试。
- 尽管已有进展,情感分析仍具挑战性,尤其因讽刺、反语和依赖上下文的情感表达,尤其在推文等短文本中更为明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。