Skip to main content
QUICK REVIEW

[论文解读] Better Document-level Sentiment Analysis from RST Discourse Parsing

Parminder Bhatia, Yangfeng Ji|arXiv (Cornell University)|Sep 4, 2015
Sentiment Analysis and Opinion Mining参考文献 43被引用 19
一句话总结

本文提出使用话语结构理论(Rhetorical Structure Theory, RST)的篇章解析来提升文档级情感分析,通过利用话语结构重新加权情感贡献或在话语树上递归传播情感。实验表明,无论采用简单的重新加权方法,还是基于RST树的递归神经网络,其性能均显著优于传统的词典基和词袋分类器,后者在基准数据集上达到了最先进(state-of-the-art)的性能表现。

ABSTRACT

Discourse structure is the hidden link between surface features and document-level properties, such as sentiment polarity. We show that the discourse analyses produced by Rhetorical Structure Theory (RST) parsers can improve document-level sentiment analysis, via composition of local information up the discourse tree. First, we show that reweighting discourse units according to their position in a dependency representation of the rhetorical structure can yield substantial improvements on lexicon-based sentiment analysis. Next, we present a recursive neural network over the RST structure, which offers significant improvements over classification-based methods.

研究动机与目标

  • 探究RST话语结构是否能在传统词袋法或词典基方法之外,提升文档级情感分析性能。
  • 评估现代、高精度RST解析器(相较于早期系统已显著改进)在下游情感分类任务中的有效性。
  • 设计并测试两种新型架构:话语感知的重新加权方法与基于RST树的递归神经网络。
  • 证明话语结构能够解决多句文本中仅依赖情感词计数会产生误导的语境模糊性问题。
  • 提供一种实用、可插拔的方案,将现成的RST解析器与现有情感分析流程无缝集成。

提出的方法

  • 基于RST树的类似依存结构的表示,根据话语单元在树中的位置进行重新加权,使用预定义函数或从少量标注数据中学习的权重。
  • 构建一个递归神经网络(RNN),将情感分数沿RST解析树向上传播,通过学习的权重矩阵组合子单元的表示。
  • 采用DPLP RST解析器(Ji and Eisenstein, 2014)作为话语解析器,该解析器在话语关系识别任务上达到最先进F值。
  • 将基于RST的方法应用于基于词典的情感分析与监督分类模型,实现与现有系统的兼容。
  • 通过RST树结构端到端训练递归模型,使用反向传播算法,以情感分数作为目标。
  • 在Pang和Lee(2004)数据集上评估两种方法,与基线词典法和词袋分类器进行性能对比。

实验结果

研究问题

  • RQ1RST解析得到的话语结构是否能超越表面词频统计,提升文档级情感分析性能?
  • RQ2话语单元在RST树中的位置是否与其在决定整体情感极性中的重要性相关?
  • RQ3基于RST解析树的递归神经网络能否有效将局部情感组合为全局文档级预测?
  • RQ4相较于早期系统(如SPADE),现代高精度RST解析器在情感分析任务中能带来多大程度的性能提升?
  • RQ5话语感知的重新加权或递归组合方法是否能有效结合基于词典与基于分类器的情感分析?

主要发现

  • 基于话语树深度与核心性(nuclearity)的重新加权方法显著提升了基于词典的情感分析性能,准确率高于基线方法。
  • 基于RST结构的递归神经网络在性能上优于词袋分类器与基于词典的系统,凸显了组合建模的强大能力。
  • 在Pang和Lee(2004)数据集上,所提出的递归模型达到了最先进性能,准确率比以往基于词典的方法高出10%以上。
  • 当情感被语境掩盖时(如让步结构:'它本可以很棒,但……'),性能提升尤为显著,此时最终的负面从句主导了整体情感极性。
  • 研究证实,现代RST解析器(如DPLP)现已具备足够高的精度,可有效服务于下游NLP任务(如情感分析),而早期系统(如SPADE)则不然。
  • 结果表明,话语结构是连接表面特征与文档级情感之间缺失的关键环节,应在情感分析流程中加以整合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。