Skip to main content
QUICK REVIEW

[论文解读] Entity-Specific Sentiment Classification of Yahoo News Comments

Prakhar Biyani, Cornelia Caragea|arXiv (Cornell University)|Jun 11, 2015
Sentiment Analysis and Opinion Mining参考文献 21被引用 3
一句话总结

本文提出一种针对雅虎新闻评论中实体特定情感分类的两阶段方法,通过上下文感知的实体抽取和新颖的非词汇特征(如实体类型、语法角色)来提升情感检测效果。该方法优于强基线模型,在情感极性分类任务中取得 0.700 的 F-1 得分,其中 IsPerson 和 IsSubjObj 特征表现最为关键。

ABSTRACT

Sentiment classification is widely used for product reviews and in online social media such as forums, Twitter, and blogs. However, the problem of classifying the sentiment of user comments on news sites has not been addressed yet. News sites cover a wide range of domains including politics, sports, technology, and entertainment, in contrast to other online social sites such as forums and review sites, which are specific to a particular domain. A user associated with a news site is likely to post comments on diverse topics (e.g., politics, smartphones, and sports) or diverse entities (e.g., Obama, iPhone, or Google). Classifying the sentiment of users tied to various entities may help obtain a holistic view of their personality, which could be useful in applications such as online advertising, content personalization, and political campaign planning. In this paper, we formulate the problem of entity-specific sentiment classification of comments posted on news articles in Yahoo News and propose novel features that are specific to news comments. Experimental results show that our models outperform state-of-the-art baselines.

研究动机与目标

  • 为解决多领域新闻平台(如雅虎新闻)用户评论中情感与特定实体相关联而非固定目标的问题,填补情感分析的空白。
  • 克服新闻评论情感分类中的挑战,如无关实体和隐含情感(如反语、反问句)的影响。
  • 设计并评估新颖的非词汇特征(如实体类型(人物/非人物)和语法角色(主语/宾语)),以提升情感检测效果。
  • 开发并实现一种上下文抽取算法,识别评论中与情感表达相关的实体,过滤掉与情感无关的实体。
  • 证明评论特定特征(如情感强度、问号)可进一步提升极性分类性能。

提出的方法

  • 该方法采用两阶段分类流程:首先识别与情感相关的实体,然后对这些实体进行情感极性分类。
  • 一种上下文抽取算法识别评论中的实体及其上下文,提升特征的相关性并减少无关实体带来的噪声。
  • 引入非词汇特征,如 IsPerson(实体是否为人物)和 IsSubjObj(实体是否为主语或宾语),以捕捉句法和语义角色。
  • 使用评论特定特征——如 NumNeg(负面词数量)、PosVsNeg(正面词与负面词的比率)和 IsQuesMark(问号是否存在)——来建模情感强度和修辞线索。
  • 模型结合词袋(BoW)特征、词性标注(POS)标签以及情感词典得分(SentiStrength)以增强极性分类效果。
  • 通过信息增益(IG)评估特征重要性,结果显示 IsPerson 和 IsSubjObj 为最具有信息量的特征,优于基于词汇的特征(如 HasClues 和 SentiStrength)。

实验结果

研究问题

  • RQ1上下文感知的实体抽取能否提升新闻评论中情感相关实体的识别效果?
  • RQ2非词汇特征(如实体类型和语法角色)在区分情感相关与无关实体方面的有效性如何?
  • RQ3评论特定特征(如情感强度、问号)在传统词汇和词性标注特征之外,能在多大程度上提升极性分类性能?
  • RQ4隐含情感表达(如反语、反问句)对情感分类有何影响?该模型能否有效检测这些表达?
  • RQ5不同特征对情感分类性能的相对贡献如何?哪些特征最具信息量?

主要发现

  • 所提模型在情感极性分类任务中取得 0.700 的 F-1 得分,显著优于所有基线模型,包括基于特征的 SentiStrength(F-1 = 0.674)。
  • 移除 IsPerson 特征后,F-1 得分降至 0.574,表明其为最具信息量的特征,其次是 IsSubjObj(F-1 = 0.636)。
  • 通过信息增益得出的特征重要性排序确认:IsPerson > IsSubjObj > SentiNeg > HasClues > SentiPos,表明非词汇特征优于词汇特征。
  • 添加评论特定特征(CSF)后,F-1 得分从 0.687 提升至 0.700,证明其在捕捉修辞和情感强度线索方面的价值。
  • 该模型优于 NaiveContextExtraction(F-1 = 0.491),表明准确上下文抽取的重要性。
  • 模型对隐含情感具有鲁棒性,体现在对反语和反问句等例子的高性能表现,而传统模型在这些情况下表现不佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。