Skip to main content
QUICK REVIEW

[论文解读] Combining Sentiment Lexica with a Multi-View Variational Autoencoder

Alexander Hoyle, Lawrence Wolf-Sonkin|arXiv (Cornell University)|Apr 5, 2019
Sentiment Analysis and Opinion Mining被引用 5
一句话总结

本文提出 SentiVAE,一种多视角变分自编码器,可将不同尺度的情感词典——二值、分类和连续——统一为共享的狄利克雷潜在表征。通过将每个词典视为一个视角并利用共享潜在变量,SentiVAE 生成了更具鲁棒性、覆盖更全面的情感表征,其在九个英文情感分类数据集上的表现优于单一词典及简单组合,尤其在低资源领域表现更优。

ABSTRACT

When assigning quantitative labels to a dataset, different methodologies may rely on different scales. In particular, when assigning polarities to words in a sentiment lexicon, annotators may use binary, categorical, or continuous labels. Naturally, it is of interest to unify these labels from disparate scales to both achieve maximal coverage over words and to create a single, more robust sentiment lexicon while retaining scale coherence. We introduce a generative model of sentiment lexica to combine disparate scales into a common latent representation. We realize this model with a novel multi-view variational autoencoder (VAE), called SentiVAE. We evaluate our approach via a downstream text classification task involving nine English-Language sentiment analysis datasets; our representation outperforms six individual sentiment lexica, as well as a straightforward combination thereof.

研究动机与目标

  • 解决将使用不同标注尺度(二值、分类或连续)的情感词典整合为单一一致表征的挑战。
  • 通过整合多个词典并保持尺度一致性,提升情感词典的覆盖范围与鲁棒性。
  • 开发一种生成模型,学习跨不同词典的共享潜在情感表征,以提升下游任务性能。
  • 在多样化情感分析数据集上评估统一表征的有效性,特别是那些在标准词典中代表性不足的数据集。

提出的方法

  • SentiVAE 采用多视角变分自编码器架构,将每个情感词典视为同一潜在词情感的独立视角。
  • 模型为每个词使用狄利克雷分布作为潜在变量,实现对多尺度情感极性概率建模。
  • 每个词典为模型贡献独立的发射分布,其参数由共享潜在表征条件化。
  • 模型通过变分推断端到端训练,优化观测词典标签边际似然的下界。
  • 最终的情感表征由潜在狄利克雷分布的后验均值得到,聚合了所有词典的信息。
  • 一个简单的基线方法通过拼接极性向量整合词典,但未进行尺度对齐或潜在建模。

实验结果

研究问题

  • RQ1生成模型能否有效将具有异质尺度(二值、分类和连续)的情感词典统一为单一一致表征?
  • RQ2SentiVAE 学习到的共享潜在表征是否在下游情感分类任务中优于单个情感词典?
  • RQ3SentiVAE 在标准情感词典支持不足的领域(如社交媒体和产品评论)的数据集上表现如何?
  • RQ4与简单拼接词典相比,模型性能在多大程度上依赖于尺度一致性和词汇覆盖范围?
  • RQ5在多分类与二分类情感分类任务上,模型的表征是否表现出更强的鲁棒性?

主要发现

  • SentiVAE 在九个情感分类数据集中的八个上优于全部六个单一情感词典,IMDB(二分类)最高准确率达 74.7%,SemEval(三分类)达 72.4%。
  • 使用潜在狄利克雷分布后验均值的模型表征在九个数据集中的六个上优于任一单一词典。
  • 即使仅限于单一词典的词汇,SentiVAE 的表征仍优于该词典本身,表明其表征质量更高。
  • 在标准词典支持不足的领域(如社交媒体和产品评论)的数据集上,SentiVAE 显著优于简单的拼接基线。
  • 模型在多样化领域中保持强劲性能,展现出超越任一单一词典范围的泛化能力。
  • 覆盖度分析显示,SentiVAE 在所有数据集训练集上实现 100% 的词汇覆盖,远超单一词典(如 SentiWordNet 在 IMDB 上仅 15%)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。