Skip to main content
QUICK REVIEW

[论文解读] Dynamic Allocation of Crowd Contributions for Sentiment Analysis during the 2016 U.S. Presidential Election

Mehrnoosh Sameki, Mattia Gentil|arXiv (Cornell University)|Aug 31, 2016
Sentiment Analysis and Opinion Mining参考文献 13被引用 4
一句话总结

本文提出了一种动态众包框架,根据预测的难度(特别是反语)为情感标注的推文分配不同数量的众包工作者,采用离线和在线决策树方法。该方法将标注成本降低了最多40%,同时保持了高准确率,优于固定工作者数量的静态分配方案。

ABSTRACT

Opinions about the 2016 U.S. Presidential Candidates have been expressed in millions of tweets that are challenging to analyze automatically. Crowdsourcing the analysis of political tweets effectively is also difficult, due to large inter-rater disagreements when sarcasm is involved. Each tweet is typically analyzed by a fixed number of workers and majority voting. We here propose a crowdsourcing framework that instead uses a dynamic allocation of the number of workers. We explore two dynamic-allocation methods: (1) The number of workers queried to label a tweet is computed offline based on the predicted difficulty of discerning the sentiment of a particular tweet. (2) The number of crowd workers is determined online, during an iterative crowd sourcing process, based on inter-rater agreements between labels.We applied our approach to 1,000 twitter messages about the four U.S. presidential candidates Clinton, Cruz, Sanders, and Trump, collected during February 2016. We implemented the two proposed methods using decision trees that allocate more crowd efforts to tweets predicted to be sarcastic. We show that our framework outperforms the traditional static allocation scheme. It collects opinion labels from the crowd at a much lower cost while maintaining labeling accuracy.

研究动机与目标

  • 为解决政治推文中情感分析存在的高评分者间不一致问题,特别是由于反语和模糊性导致的问题。
  • 通过动态分配更多工作者给困难的、具有反语性质的推文,更少分配给简单推文,提高众包的成本效率。
  • 评估基于内容特征或迭代一致性的动态分配是否相比静态的固定工作者方案能提升准确性。
  • 创建一个经验证的1,000条政治推文数据集,包含每位候选人的专家标注情感标签及反语标签,以供未来研究使用。

提出的方法

  • 开发了一种反语检测模型,用于识别可能具有模糊性或反语性质的推文,作为标注难度的代理指标。
  • 构建了一个离线决策树,根据内容特征(包括反语预测和候选人提及)为每条推文分配固定数量的工作者。
  • 实现了在线动态分配方法,根据先前标注轮次的评分者间一致性,实时迭代调整工作者数量。
  • 通过分配工作者的多数投票确定每条推文每位候选人的最终情感标签(正面、中性、负面)。
  • 通过两位政治传播研究专家的联合标注建立黄金标准,用于评估准确性。
  • 使用F1分数和成本指标评估性能,对比1,000条推文中动态与静态分配策略的表现。

实验结果

研究问题

  • RQ1基于预测的推文难度进行动态工作者分配,是否能在相比静态分配方案时提升标注准确性并降低标注成本?
  • RQ2在工作者分配中引入反语检测,如何影响政治推文情感标注的可靠性?
  • RQ3基于评分者间一致性的在线、迭代式调整工作者数量,在多大程度上提升了效率和准确性?
  • RQ4与专家标注的黄金标准相比,众包标注的情感标签在F1分数和一致率方面表现如何?
  • RQ5在政治社交媒体情感分析中,动态分配与固定工作者方案相比,其成本-性能权衡如何?

主要发现

  • 该动态分配框架将众包工作者标注总数从静态方案中的5,075次减少至约3,000次,实现了40%的标注成本降低。
  • 离线方法(基于反语预测预先分配工作者)的F1得分为0.78,优于静态基线的0.72。
  • 在线方法(根据评分者间一致性实时调整工作者数量)的F1得分为0.81,表现出更高的准确率和更强的适应性。
  • 具有反语性质的推文在众包工作者中的一致率显著较低(47%的一致率),证实其标注难度更高。
  • 专家标注的“中性”标签数量显著多于众包工作者,表明众包标注存在偏向情绪性(正面/负面)标签的偏差。
  • 包含每位候选人情感标签及反语标签的1,000条推文数据集已公开,为多情感分析和反语检测研究提供了有价值的基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。