Skip to main content
QUICK REVIEW

[论文解读] $ ho$-hot Lexicon Embedding-based Two-level LSTM for Sentiment Analysis

Ou Wu, Tao Yang|arXiv (Cornell University)|Mar 21, 2018
Sentiment Analysis and Opinion Mining参考文献 22被引用 3
一句话总结

该论文提出一种两级LSTM模型,结合ρ-hot词典嵌入方法,以提升中文情感分析性能,尤其在噪声或模糊标注条件下表现更优。通过采用两阶段标注策略——将纯情感与混合情感文本分离——并利用ρ-hot编码整合词汇线索(极性词、词性标注、连词等),该方法在三个中文情感分析数据集上达到当前最优准确率,优于现有的深度学习与基于词典的方法。

ABSTRACT

Sentiment analysis is a key component in various text mining applications. Numerous sentiment classification techniques, including conventional and deep learning-based methods, have been proposed in the literature. In most existing methods, a high-quality training set is assumed to be given. Nevertheless, constructing a high-quality training set that consists of highly accurate labels is challenging in real applications. This difficulty stems from the fact that text samples usually contain complex sentiment representations, and their annotation is subjective. We address this challenge in this study by leveraging a new labeling strategy and utilizing a two-level long short-term memory network to construct a sentiment classifier. Lexical cues are useful for sentiment analysis, and they have been utilized in conventional studies. For example, polar and privative words play important roles in sentiment analysis. A new encoding strategy, that is, $ ho$-hot encoding, is proposed to alleviate the drawbacks of one-hot encoding and thus effectively incorporate useful lexical cues. We compile three Chinese data sets on the basis of our label strategy and proposed methodology. Experiments on the three data sets demonstrate that the proposed method outperforms state-of-the-art algorithms.

研究动机与目标

  • 为解决情感标注具有主观性且复杂,导致构建高质量训练数据的挑战。
  • 通过利用极性词、词性(POS)和连词等词汇线索,提升情感分类性能。
  • 设计一种新颖的两阶段标注策略,将纯情感与混合情感文本分离,以实现更有效的模型训练。
  • 提出ρ-hot编码作为传统one-hot编码的更优替代方案,用于捕捉情感分析中的词汇特征。
  • 设计一种两级LSTM架构,联合学习来自两种不同标注数据分布(纯情感 vs. 混合情感)的表示,以增强表征与分类能力。

提出的方法

  • 引入两阶段标注策略:首先,标注者对大量文本进行纯情感倾向标注(每样本一个标签);其次,由多名标注者对少量混合情感文本进行标注,以捕捉标注中的模糊性。
  • 提出两级LSTM网络以建模层次化情感表征:第一层编码纯情感序列,第二层整合混合情感上下文。
  • 使用词典嵌入将语言知识注入模型,将极性词、词性标签和连词作为可学习特征进行编码。
  • 引入ρ-hot编码作为one-hot编码的替代方案,允许多个相关词汇(如情感线索)同时编码,并赋予不同权重贡献。
  • 为不同词汇线索(极性词、POS、连词)设置独立的嵌入层,经拼接后输入两级LSTM进行联合表征学习。
  • 模型采用交叉熵损失端到端训练,ρ和ρ-hot编码中的n等超参数通过网格搜索进行调优。

实验结果

研究问题

  • RQ1是否可通过将纯情感与混合情感文本分离的两阶段标注策略,提升情感分类训练数据的质量与实用性?
  • RQ2通过词典嵌入整合词汇线索(极性词、POS、连词)是否能提升深度学习模型在情感分析中的性能?
  • RQ3ρ-hot编码是否在捕捉文本中语义与情感相关特征方面优于传统one-hot编码?
  • RQ4两级LSTM架构是否能有效从两种不同数据分布(纯情感 vs. 混合情感)中学习层次化情感表征?
  • RQ5不同组件(如极性词、POS、连词)对最终分类准确率的贡献程度如何?

主要发现

  • 所提出的ρTl-LSTM模型在三个中文情感分析数据集上均取得最高准确率,优于当前最先进方法。
  • 在词典嵌入中使用全部极性词,相比不使用极性词,准确率最高提升4.7%,在酒店数据集上最高准确率达到0.837。
  • 在词典嵌入中引入词性线索,相比无POS的模型,性能最高提升1.5%,在酒店语料上最佳结果达0.837。
  • 加入连词嵌入后进一步提升准确率,当使用全部连词时,移动设备数据集上最佳性能达0.841。
  • ρTl-LSTM-W模型在移动数据集上取得最高准确率0.841,而ρTl-LSTM-C在酒店数据集上达到0.837,表明在各数据集上均保持一致的优越性。
  • ρ-hot编码的最优ρ值为5–10,在酒店数据集上ρ=5时达到最高准确率0.837。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。