Skip to main content
QUICK REVIEW

[论文解读] DeepSentiPers: Novel Deep Learning Models Trained Over Proposed Augmented Persian Sentiment Corpus

Javad Pourmostafa Roshan Sharami, Parsa Abbasi Sarabestani|arXiv (Cornell University)|Apr 11, 2020
Sentiment Analysis and Opinion Mining参考文献 23被引用 18
一句话总结

该论文提出 DeepSentiPers,一种新颖的深度学习框架,用于使用两种新架构——Bi-LSTM 和 CNN——在增强的波斯语情感语料库上进行波斯语句子级情感分析。该研究引入了三种数据增强技术,其中基于翻译的增强方法效果最佳:在使用 FastText 嵌入和 Bi-LSTM 的情况下,二分类任务的 F1 分数达到 91.986%,多分类情感分析的 F1 分数达到 69.33%。

ABSTRACT

This paper focuses on how to extract opinions over each Persian sentence-level text. Deep learning models provided a new way to boost the quality of the output. However, these architectures need to feed on big annotated data as well as an accurate design. To best of our knowledge, we do not merely suffer from lack of well-annotated Persian sentiment corpus, but also a novel model to classify the Persian opinions in terms of both multiple and binary classification. So in this work, first we propose two novel deep learning architectures comprises of bidirectional LSTM and CNN. They are a part of a deep hierarchy designed precisely and also able to classify sentences in both cases. Second, we suggested three data augmentation techniques for the low-resources Persian sentiment corpus. Our comprehensive experiments on three baselines and two different neural word embedding methods show that our data augmentation methods and intended models successfully address the aims of the research.

研究动机与目标

  • 解决深度学习领域中缺乏高质量、平衡的波斯语情感语料库的问题。
  • 开发新型深度学习架构——Bi-LSTM 和 CNN——以处理波斯语中的二分类和多分类情感分类任务。
  • 提出并评估三种数据增强技术,以改善低资源波斯语情感数据集中的类别平衡问题。
  • 比较预训练(FastText)与学习得到的(Keras)词嵌入在情感分类任务中的表现。
  • 证明 Bi-LSTM 在捕捉波斯语文本情感分析中的长距离依赖关系方面优于 CNN。

提出的方法

  • 提出两种深度学习架构:一种是用于波斯语句子级情感分类的 Bi-LSTM 模型,另一种是 CNN 模型。
  • 应用三种数据增强技术——类别重平衡、反向翻译和同义词替换——以改善训练数据的平衡性与多样性。
  • 通过 Keras 和 FastText 使用词嵌入,将词语表示为密集的低维语义空间。
  • 使用 10% 的 dropout 防止过拟合,并在二分类任务的最终全连接层中使用 Sigmoid 激活函数。
  • 由于原始数据集中类别不平衡,采用加权 F1 分数作为主要评估指标。
  • 使用基线机器学习模型(NB、SVM、SGD)和深度学习模型进行训练,比较不同数据增强配置下的性能表现。

实验结果

研究问题

  • RQ1与传统机器学习基线相比,新型深度学习架构是否能提升在低资源波斯语文本上的情感分类性能?
  • RQ2在类别重平衡、反向翻译和同义词替换这三种数据增强技术中,哪一种最有效地提升在类别不平衡的波斯语情感数据集上的模型泛化能力?
  • RQ3词嵌入的选择(Keras 与 FastText)是否显著影响深度学习模型在波斯语情感分析中的性能?
  • RQ4Bi-LSTM 是否在捕捉波斯语文本情感分类中的长距离依赖关系方面优于 CNN?
  • RQ5统一的深度学习框架是否能有效处理波斯语中的二分类和多分类情感分类任务?

主要发现

  • 采用基于翻译的数据增强和 FastText 嵌入的 Bi-LSTM 模型在多分类情感分析中取得了最高的 F1 分数 69.33%。
  • 采用基于翻译的数据增强的 Bi-LSTM 模型在二分类任务中取得了 91.986% 的 F1 分数,比基线模型高出 0.674%。
  • 基于翻译的数据增强在所有配置下均一致地提升了模型性能,并在三种增强技术中排名最高。
  • 在二分类和多分类设置中,FastText 嵌入均优于 Keras 嵌入,尤其在 Bi-LSTM 架构中表现更优。
  • Bi-LSTM 模型在处理波斯语文本中的长距离依赖关系方面显著优于 CNN 模型。
  • 本研究证实,词嵌入的选择具有上下文依赖性,且不存在一种嵌入方法在所有任务中均普遍优于其他方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。