Skip to main content
QUICK REVIEW

[论文解读] Structured Neural Topic Models for Reviews

Babak Esmaeili, Hongyi Huang|arXiv (Cornell University)|Dec 12, 2018
Topic Modeling被引用 14
一句话总结

VALTA 是一种变分自编码主题模型,通过将用户和商品评论联合编码为结构化嵌入,学习到解耦的、基于方面(aspect-based)的评论表征。它在主题连贯性、方面分类以及类型发现和推荐等下游任务中均优于非结构化基线模型,通过分层方面与主题建模,显著提升了可解释性与泛化能力。

ABSTRACT

We present Variational Aspect-based Latent Topic Allocation (VALTA), a family of autoencoding topic models that learn aspect-based representations of reviews. VALTA defines a user-item encoder that maps bag-of-words vectors for combined reviews associated with each paired user and item onto structured embeddings, which in turn define per-aspect topic weights. We model individual reviews in a structured manner by inferring an aspect assignment for each sentence in a given review, where the per-aspect topic weights obtained by the user-item encoder serve to define a mixture over topics, conditioned on the aspect. The result is an autoencoding neural topic model for reviews, which can be trained in a fully unsupervised manner to learn topics that are structured into aspects. Experimental evaluation on large number of datasets demonstrates that aspects are interpretable, yield higher coherence scores than non-structured autoencoding topic model variants, and can be utilized to perform aspect-based comparison and genre discovery.

研究动机与目标

  • 开发一种完全无监督的神经主题模型,以学习用户评论中解耦的、可解释的基于方面的表征。
  • 通过建模包含方面与子方面的分层结构化组件,提升可解释性与预测能力。
  • 通过学习结构化的商品表征,实现基于方面的商品比较与聚类。
  • 通过解耦表征(如情感与主题等独立特征)提升数据效率与泛化能力。
  • 在下游任务(如方面分类、类型发现与推荐)中评估模型性能。

提出的方法

  • VALTA 使用用户-商品编码器,将用户-商品评论的组合袋(bag)映射为定义每个方面主题权重的结构化嵌入。
  • 为每条评论中的句子分配一个方面,利用该方面的特定主题权重,定义词上的对数线性似然。
  • 模型采用变分自编码器(VAE)框架,并使用 Concrete 分布参数化方面分配,实现可微分推理。
  • 主题与方面权重由用户与商品嵌入预测得出,实现对评论者偏好与商品特征的联合建模。
  • 生成模型以端到端无监督方式训练,以重建评论并预测评分,从而同时提升表征质量与推荐性能。
  • 子方面以分层方式建模,每个方面包含一组子方面主题,实现对特征的细粒度解耦。

实验结果

研究问题

  • RQ1神经主题模型能否在完全无监督的情况下,从非结构化评论文本中学习到解耦且可解释的方面?
  • RQ2与非结构化基线相比,通过结构化方面与子方面建模是否能提升主题连贯性与可解释性?
  • RQ3所学习的基于方面的表征是否能有效支持基于方面的商品比较与聚类?
  • RQ4结构化表征在多大程度上提升了零样本泛化能力,并改善了方面分类与推荐等下游任务的性能?
  • RQ5在困惑度、连贯性与推荐准确率方面,该模型与当前最先进方法相比表现如何?

主要发现

  • VALTA 在 CitySearch 与 BeerAdvocate 数据集上的句子级方面分类任务中,F1 分数与准确率均高于 LDA 与 Local-LDA,表现最优。
  • VALTA 在句子与评论两个层级上的 NPMI 分数显著高于基线模型,表明其主题连贯性更优,且与人类判断更一致。
  • 在 BeerAdvocate 数据集上,VALTA 的 F1 分数达到 0.78,准确率为 0.75,较次优基线高出超过 5 个百分点。
  • 在无监督商品聚类任务中,VALTA 显著优于所有基线模型;基于学习表征的多分类 SVM 准确率更高,归因于结构化方面建模。
  • 在推荐任务中,VALTA 在所有数据集上均取得最低 MSE:Beer 数据集为 0.437,Yelp 数据集为 1.236,Clothing 数据集为 0.315,Movies 数据集为 0.154,优于 MF、LDA 与 VRLDA。
  • 商品表征的核密度估计显示,按方面呈现清晰聚类(如 'American Porter' 与 'dark' 和 'sweet' 方面聚类),证实了模型实现有意义基于方面的比较能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。