Skip to main content
QUICK REVIEW

[论文解读] Sentiment analysis of twitter data

Hamid Bagheri, Johirul Islam|arXiv (Cornell University)|Nov 15, 2017
Sentiment Analysis and Opinion Mining被引用 4
一句话总结

本文提出了一种实用的框架,通过实时API集成和自然语言处理技术,对Twitter数据进行情感分析。该方法在从政治到人道主义议题等多样化主题上进行了演示,揭示了中性情感的普遍性,凸显了当前情感分析模型在处理中性内容方面的局限性,并呼吁改进对中性内容的处理方式。

ABSTRACT

Social networks are the main resources to gather information about people's opinion and sentiments towards different topics as they spend hours daily on social media and share their opinion. In this technical paper, we show the application of sentimental analysis and how to connect to Twitter and run sentimental analysis queries. We run experiments on different queries from politics to humanity and show the interesting results. We realized that the neutral sentiments for tweets are significantly high which clearly shows the limitations of the current works.

研究动机与目标

  • 展示一种使用实时数据采集的Twitter数据情感分析实用方法。
  • 评估政治和人道主义议题等多样化主题中的情感分布情况。
  • 识别并分析Twitter数据中中性情感所占的高比例。
  • 突出由于中性内容过度代表而导致现有情感分析模型存在的局限性。
  • 为研究人员和实践者提供一个可复现的技术流水线。

提出的方法

  • 作者使用Twitter API基于预定义查询收集实时推文。
  • 对收集到的推文应用文本预处理以进行清洗和规范化。
  • 使用成熟的NLP技术与情感词典执行情感分类。
  • 系统在包括政治和人道主义主题在内的多样化领域处理查询。
  • 分析情感分布以识别模式,尤其是中性情感的普遍性。
  • 在一系列样本查询上实现并测试该框架,以验证性能和一致性。

实验结果

研究问题

  • RQ1如何有效将情感分析应用于实时Twitter数据?
  • RQ2在多样化Twitter主题中,情感类别(正面、负面、中性)的分布如何?
  • RQ3为何Twitter数据中中性情感的比例显著偏高?
  • RQ4当前情感分析模型在处理中性内容方面失败的程度有多大?
  • RQ5能否构建一个实用且可复现的Twitter情感分析流水线?

主要发现

  • 大量推文被分类为中性,表明当前情感分析系统存在重大局限性。
  • 中性情感的高比例表明现有模型可能未针对中性内容检测进行优化。
  • 不同主题的情感分析结果存在差异,政治和人道主义议题显示出独特的情感模式。
  • 该研究证实,通过API实现对实时Twitter数据的采集在情感分析任务中是可行且有效的。
  • 研究结果强调了需要开发更优的模型,以更好地处理社交媒体中中性或模糊的语言。
  • 技术流水线成功展示了在多样化查询类别中的情感分类能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。