[论文解读] Language-Independent Sentiment Analysis Using Subjectivity and Positional Information
本文提出了一种语言无关的情感分析方法,通过结合词语和双词的定位加权与主观性估计,提升情感极性分类性能。采用多项式朴素贝叶斯分类器,在标准电影评论数据集上达到89.85%的准确率,与最佳语言无关结果相当,且无需外部语言资源或解析器。
We describe a novel language-independent approach to the task of determining the polarity, positive or negative, of the author's opinion on a specific topic in natural language text. In particular, weights are assigned to attributes, individual words or word bi-grams, based on their position and on their likelihood of being subjective. The subjectivity of each attribute is estimated in a two-step process, where first the probability of being subjective is calculated for each sentence containing the attribute, and then these probabilities are used to alter the attribute's weights for polarity classification. The evaluation results on a standard dataset of movie reviews shows 89.85% classification accuracy, which rivals the best previously published results for this dataset for systems that use no additional linguistic information nor external resources.
研究动机与目标
- 开发一种不依赖外部语言资源(如解析器、词性标注器或词干提取器)的语言无关情感极性分类系统。
- 通过整合词语和双词的定位信息及主观性概率,提升情感分类准确率。
- 评估主观性估计作为无需语言特异性语言工具即可加权属性的方法的有效性。
- 证明语言无关特征在结合主观性与位置信息后,可与使用语言分析的更复杂系统相媲美或超越其性能。
- 探索利用主观性分数优化特征加权与句子级优先排序在情感分类中的潜力。
提出的方法
- 该方法使用基于词语位置和估计主观性概率的属性权重的多项式朴素贝叶斯分类器。
- 主观性概率通过两步计算:首先,使用独立的主观性数据集估计句子级主观性概率;其次,利用这些概率调整属性权重。
- 属性权重与位置相关,位于句子中更中心或更显著位置的词语或双词被赋予更高权重。
- 该方法采用0+q加权方案,其中q控制位置的影响,当q=1时性能最优。
- 系统利用主观性数据集过滤客观句子,并根据主观性概率对剩余句子重新排序,以提升特征的相关性。
- 该方法未使用词性标注、依存解析或词干提取,从而保持语言独立性。
实验结果
研究问题
- RQ1是否仅使用位置与主观性信息而无需语言分析即可提升情感分类准确率?
- RQ2将主观性概率纳入属性加权对情感极性分类性能有何影响?
- RQ3根据主观性得分对句子排序是否相比使用原始句子顺序能获得更好的分类结果?
- RQ4语言无关模型是否能在无需外部语言资源(如解析器或词性标注器)的情况下实现具有竞争力的准确率?
- RQ5将未igram与bigram结合位置与主观性加权特征对分类性能有何影响?
主要发现
- 所提方法在标准电影评论数据集上达到89.85%的准确率,该结果具有统计显著性,与以往最佳语言无关结果相当。
- 仅使用unigram与bigram并结合位置相关权重的基线方法准确率为87.81%,显著优于未使用主观性或位置加权的85.59%基线。
- 使用主观性数据集按主观性概率对句子排序可达到89.38%的准确率,但与基线相比该提升不具统计显著性。
- 当结合unigram、bigram与基于位置和主观性的属性加权时,达到最高准确率89.85%。
- 该方法优于以往报告的最佳语言无关结果,甚至超越了部分使用语言特征的系统,例如Matsumoto等人使用SVM结合unigram与bigram报告的88.1%准确率。
- 最佳结果(89.85%)的95% Wilson置信区间为[88.45%, 91.10%],确认其在统计上显著优于以往的语言无关方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。