Skip to main content
QUICK REVIEW

[论文解读] Fine-Grained Emotion Classification of Chinese Microblogs Based on Graph Convolution Networks

Yuni Lai, Linfeng Zhang|arXiv (Cornell University)|Dec 5, 2019
Sentiment Analysis and Opinion Mining参考文献 35被引用 5
一句话总结

该论文提出了一种语法感知的图卷积网络(GCN)模型,通过利用依存句法树来提升中文微博的细粒度情绪分类性能。通过将双向LSTM特征与GCN中的句法结构相结合,并引入分位数池化机制,该模型在新标注的15,664条微博数据集上实现了82.32%的F1值,较当前最先进方法高出5.90个百分点。

ABSTRACT

Microblogs are widely used to express people's opinions and feelings in daily life. Sentiment analysis (SA) can timely detect personal sentiment polarities through analyzing text. Deep learning approaches have been broadly used in SA but still have not fully exploited syntax information. In this paper, we propose a syntax-based graph convolution network (GCN) model to enhance the understanding of diverse grammatical structures of Chinese microblogs. In addition, a pooling method based on percentile is proposed to improve the accuracy of the model. In experiments, for Chinese microblogs emotion classification categories including happiness, sadness, like, anger, disgust, fear, and surprise, the F-measure of our model reaches 82.32% and exceeds the state-of-the-art algorithm by 5.90%. The experimental results show that our model can effectively utilize the information of dependency parsing to improve the performance of emotion detection. What is more, we annotate a new dataset for Chinese emotion classification, which is open to other researchers.

研究动机与目标

  • 为解决中文微博中复杂句法结构导致情绪检测不准确的挑战,实现细粒度情绪分类。
  • 通过整合通常在现有方法中被低估的句法依存信息,提升深度学习模型性能。
  • 通过一种新颖的基于分位数的池化机制,降低对异常值的敏感性,提升模型鲁棒性与性能。
  • 贡献一个新构建的、高质量的、公开可获取的15,664条标注中文微博数据集,用于细粒度情绪分类。

提出的方法

  • 使用双向LSTM(Bi-LSTM)从微博文本中提取初始的词级表征。
  • 从输入文本构建依存句法树,将每个词作为节点,句法依存关系作为边,形成图结构。
  • 图卷积网络(GCN)在依存图上执行消息传递,通过聚合句法邻居的特征来更新词表征。
  • 对GCN的最终隐藏状态应用分位数池化策略,替代传统的最大池化,以提升对异常值的鲁棒性。
  • 对Bi-LSTM和GCN的权重矩阵施加正交化约束,以稳定训练过程并改善长距离依赖的学习能力。
  • 模型通过端到端微调,实现对七类情绪(喜悦、悲伤、喜欢、愤怒、厌恶、恐惧、惊讶)的多分类情绪识别。

实验结果

研究问题

  • RQ1通过图卷积网络整合句法依存结构,能否提升中文微博细粒度情绪分类的性能?
  • RQ2在基于神经网络的情绪检测中,分位数池化与传统最大池化相比,在鲁棒性与分类准确率方面表现如何?
  • RQ3对Bi-LSTM与GCN层施加正交化约束,能在多大程度上提升模型收敛速度与性能?
  • RQ4所提出的模型能否泛化至二元情感分类(正面 vs. 负面)?在该设定下与现有模型相比表现如何?

主要发现

  • 所提出的基于语法的GCN模型在细粒度情绪分类任务上达到82.32%的F1值,较当前最先进方法高出5.90个百分点。
  • 分位数池化显著提升模型鲁棒性,在GCN模型中较最大池化提升3.55%的性能,同时使CNN和LSTM基线模型分别提升1.63%和1.65%。
  • 施加正交化约束并设置惩罚系数为$1 \times 10^{-8}$,可使宏平均F1值提升5.54%,微平均F1值提升3.39%。
  • 该模型在细粒度与二元情感分类任务中均优于现有方法,在情感极性分类中达到92.04%的准确率,高于CNN的91.65%与LSTM的90.01%。
  • 模型的性能增益在细粒度分类中最为显著,表明句法结构对区分细微情绪类型具有重要价值。
  • 该模型在英文基准数据集(如Stanford情感树库)上未表现出同等优势,表明跨语言迁移需进行语言特定的适配。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。