Skip to main content
QUICK REVIEW

[论文解读] Crowdsourcing for Beyond Polarity Sentiment Analysis A Pure Emotion Lexicon

Giannis Haralabopoulos, Elena Simperl|arXiv (Cornell University)|Oct 4, 2017
Sentiment Analysis and Opinion Mining参考文献 26被引用 5
一句话总结

本文提出了一种可扩展、低成本的众包框架,用于基于普鲁奇克的八种基本情绪创建纯情感词典(PEL),无需依赖专家或黄金标准。该方法利用众包对情绪、强度词和停用词进行标注,通过工人筛选和批量评估实现高质量结果,众包在情绪评估方面表现与专家相当,且在成本效率上更胜一筹。

ABSTRACT

Sentiment analysis aims to uncover emotions conveyed through information. In its simplest form, it is performed on a polarity basis, where the goal is to classify information with positive or negative emotion. Recent research has explored more nuanced ways to capture emotions that go beyond polarity. For these methods to work, they require a critical resource: a lexicon that is appropriate for the task at hand, in terms of the range of emotions it captures diversity. In the past, sentiment analysis lexicons have been created by experts, such as linguists and behavioural scientists, with strict rules. Lexicon evaluation was also performed by experts or gold standards. In our paper, we propose a crowdsourcing method for lexicon acquisition, which is scalable, cost-effective, and doesn't require experts or gold standards. We also compare crowd and expert evaluations of the lexicon, to assess the overall lexicon quality, and the evaluation capabilities of the crowd.

研究动机与目标

  • 开发一种可扩展、低成本的方法,用于获取超越传统极性情感分析的纯情感词典。
  • 消除在词典创建与评估中对专家标注黄金标准的依赖。
  • 评估众包情绪标注及语言元素标注(如强度词、否定词)与专家评估的质量对比。
  • 设计一种完全自动化、端到端的众包工作流,用于情感词典的获取与评估。
  • 探讨贡献者多样性与临界规模对标注质量与一致性的影响。

提出的方法

  • 使用众包对术语组进行标注,标注其属于普鲁奇克八种基本情绪中的一种或多种(如喜悦、愤怒、恐惧、悲伤、惊讶、厌恶、信任、期待)。
  • 工人被要求将术语分类为情绪、强度词、否定词或停用词,且不要求对单一情绪分配达成共识。
  • 提出一种新颖的工人筛选机制,可在不依赖黄金标准的情况下识别并排除不诚实或刷单的贡献者。
  • 界面被最小化以减少混淆,将词干和描述字段从主要任务中移除,以提高准确性。
  • 采用批量标注与评估流程,以增加每个术语组的标注数量,提升结果的可靠性。
  • 将众包的评估结果与专家评估直接对比,以评估质量与一致性。

实验结果

研究问题

  • RQ1众包能否在无专家输入或黄金标准的情况下生成高质量的纯情感词典?
  • RQ2众包情绪标注的质量与专家标注的黄金标准相比如何?
  • RQ3贡献者多样性与临界规模对情绪标注的可靠性与一致性有何影响?
  • RQ4强度词和否定词等语言元素能否被有效且客观地众包化?
  • RQ5评估者数量如何影响情绪与语言元素评估的严格程度与一致性?

主要发现

  • 众包在情绪评估质量上与专家相当,表明在经过适当筛选后,非专家标注者也能生成可靠的的情绪标签。
  • 在实施批量评估后,每个术语组的标注数量从平均 2.3 项提升至 3.2 项,提高了数据密度与可靠性。
  • 通过一种不依赖黄金标准的新颖工人筛选方法,有效减少了垃圾信息与低质量贡献。
  • 使用极简界面与简化说明显著降低了工人困惑,提升了任务表现。
  • 通过词干化与批量处理,成本降低了 45%,同时多情绪分类的标注比例仍低于总标注数的 10%。
  • 该方法与现有词典(如 NRC)实现了中等程度的重叠(40%),表明尽管源于众包,其仍与既有的情绪类别保持一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。