Skip to main content
QUICK REVIEW

[论文解读] A New Statistical Approach for Comparing Algorithms for Lexicon Based Sentiment Analysis

Mateus Tarcinalli Machado, Evandro Eduardo Seron Ruiz|arXiv (Cornell University)|Jun 20, 2019
Sentiment Analysis and Opinion Mining参考文献 16被引用 4
一句话总结

本文提出了一种无需依赖人工标注黄金标准的统计框架,用于比较基于词典的情感分析算法。通过边际同质性检验和最大似然估计的对数线性模型,研究发现算法一致性在不同标签对和词典之间存在显著差异:中性与正向/负向的一致性明显低于正向与负向之间的一致性,且LIWC在所有标签对上的一致性显著低于OpLex或SentiLex。

ABSTRACT

Lexicon based sentiment analysis usually relies on the identification of various words to which a numerical value corresponding to sentiment can be assigned. In principle, classifiers can be obtained from these algorithms by comparison with human annotation, which is considered the gold standard. In practise this is difficult in languages such as Portuguese where there is a paucity of human annotated texts. Thus in order to compare algorithms, a next best step is to directly compare different algorithms with each other without referring to human annotation. In this paper we develop methods for a statistical comparison of algorithms which does not rely on human annotation or on known class labels. We will motivate the use of marginal homogeneity tests, as well as log linear models within the framework of maximum likelihood estimation We will also show how some uncertainties present in lexicon based sentiment analysis may be similar to those which occur in human annotated tweets. We will also show how the variability in the output of different algorithms is lexicon dependent, and quantify this variability in the output within the framework of log linear models.

研究动机与目标

  • 开发一种不依赖于人工标注黄金标准的统计方法,用于比较基于词典的情感分析算法,尤其适用于葡萄牙语等资源匮乏语言。
  • 量化不同词典和标签对之间算法输出的变异性,特别是在缺乏已知类别标签的情况下。
  • 通过严格的统计推断,评估算法一致性差异是否具有统计显著性,而非偶然所致。
  • 将现有对人工标注者比较的研究扩展至机器算法,表明涉及中性情感的标签对中,算法与人工标注者表现出相似的不一致模式。
  • 为评估算法性能提供一种方法论基础,该基础可推广至情感分析之外,尤其适用于离散且互斥的标注任务。

提出的方法

  • 作者使用列联表比较同一文本语料库上两个算法的输出结果,每个单元格表示被分配特定标签对(例如,算法1标记为'n',算法2标记为'p')的文本数量。
  • 应用边际同质性检验,评估两个算法在标签分布上是否存在显著差异,以检验其整体一致性是否超出偶然水平。
  • 采用最大似然估计的对数线性模型,对算法输出的联合分布进行建模,并估计不同标签对之间的优势比。
  • 计算标签对之间一致性的95%置信区间(如n vs. u、p vs. u、n vs. p),以评估一致性差异的统计显著性。
  • 通过与文献[16]中人工标注者数据的对比,验证了该方法的有效性,结果在标签对不一致模式上保持一致。
  • 该方法在三种词典(LIWC、OpLex、SentiLex)上应用,以评估算法一致性随词典选择的变化。

实验结果

研究问题

  • RQ1两个基于词典的情感分析算法之间的一致性是否显著高于随机预期?
  • RQ2算法在不同情感标签对(如n vs. p、n vs. u、p vs. u)之间的一致性程度如何变化?
  • RQ3算法一致性是否依赖于所使用的词典选择?
  • RQ4观察到的算法一致性差异是否具有统计显著性,还是可能由抽样变异性导致?
  • RQ5算法输出的不一致模式在多大程度上与人工标注者之间的不一致模式相似?

主要发现

  • 算法之间在n vs. p标签对上的一致性显著高于n vs. u或p vs. u,表明中性情感更模糊且更难区分。
  • 对于(n,u)和(p,u)标签对,LIWC与另外两个词典(OpLex、SentiLex)的95%置信区间在对数优势比上无重叠,表明一致性存在统计显著差异。
  • LIWC在(n,u)和(p,u)标签对上的一致性对数优势比显著低于OpLex和SentiLex,表明LIWC在中性情感上的输出一致性更差。
  • 结果表明,算法一致性不仅依赖于标签,也依赖于词典选择,LIWC在所有标签对上均表现出显著低于OpLex和SentiLex的一致性。
  • 算法之间不一致的统计模式与[16]中人工标注者之间的不一致模式高度一致,尤其体现在与中性情感相关的标签对上。
  • 本研究证实,即使缺乏黄金标准标签,边际同质性检验和对数线性模型等统计方法仍能可靠检测并量化情感分析中的算法变异性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。