Skip to main content
QUICK REVIEW

[论文解读] Mixing Dirichlet Topic Models and Word Embeddings to Make lda2vec

Christopher E. Moody|arXiv (Cornell University)|May 6, 2016
Topic Modeling参考文献 14被引用 147
一句话总结

lda2vec 通过将 SGNS 与 Dirichlet 约束的文档权重以及共享主题向量结合起来,联合学习密集的词向量和稀疏、可解释的文档-主题混合。

ABSTRACT

Distributed dense word vectors have been shown to be effective at capturing token-level semantic and syntactic regularities in language, while topic models can form interpretable representations over documents. In this work, we describe lda2vec, a model that learns dense word vectors jointly with Dirichlet-distributed latent document-level mixtures of topic vectors. In contrast to continuous dense document representations, this formulation produces sparse, interpretable document mixtures through a non-negative simplex constraint. Our method is simple to incorporate into existing automatic differentiation frameworks and allows for unsupervised document representations geared for use by scientists while simultaneously learning word vectors and the linear relationships between them.

研究动机与目标

  • 动机:将密集的词表示与稀疏、基于主题的文档表示结合起来,以实现可解释性并便于科学家在下游任务中的使用。
  • 开发一个在自动微分框架内能够同时学习词向量、主题向量和每文档的主题混合的模型。
  • 在获得稀疏、便于人类解释的文档-主题比例的同时,保留词向量中的语义规律。
  • 在标准文本语料库以及一个大规模的领域特定语料库上展示该方法,以展示一致的主题及有意义的词类比关系。

提出的方法

  • 扩展 Skipgram Negative Sampling (SGNS) 目标,使其包含文档范围的特征向量和基于文档权重的主题混合。
  • 将每个上下文表示为词向量与文档向量之和(c_j = w_j + d_j),以捕捉局部信号和文档级信号。
  • 通过 softmax 变换 p_jk 将文档向量 d_j 限制为非负且充满 simplex 的主题向量 t_k 的混合,从而实现可解释性。
  • 引入一个参数为 alpha 的 Dirichlet-似然项 L^d,以在文档-主题成员资格中促进稀疏性(alpha ~ n^{-1})。
  • 在小批量中使用 Adam 端到端训练,将 L^d 按小批量大小缩放,并评估主题一致性(C_v)和词之间的相似性(3COSMUL)。
  • 可选地,使用预训练嵌入初始化词向量,并在 SGNS 的 pivot/target 角色之间共享词表示。

实验结果

研究问题

  • RQ1是否可以在一个单一的可微模型中联合学习密集的词嵌入和稀疏的文档-主题混合?
  • RQ2在文档-主题权重上强制Dirichlet基的稀疏性是否能产生与LDA可解释性相当的主题?
  • RQ3所学主题是否与人类可解释的主题保持一致,并在专业语料库中显示出连贯的词语关联?
  • RQ4该模型是否能够在领域特定词汇中捕获单词之间有意义的线性关系(类比)?
  • RQ5该方法是否可扩展到大规模语料库,并适用于标准的深度学习工具链?

主要发现

  • lda2vec 在 Twenty Newsgroups 语料库上产生连贯的主题,其主题一致性与人类评估相关。
  • 在 Hacker News 评论中,lda2vec 发现领域相关的主题并学习与词类比类似的词语相似性和线性关系。
  • 该模型通过非负且和为一的权重实现每篇文档的可解释主题混合,便于检查文档-主题组成。
  • 在某些设置下主题一致性有所提高,例如 20 个主题、beta=0.75 时平均一致性达到 0.567(相比其他配置)。
  • 该方法在自动微分框架中实现起来相对简单,并且可以利用 GPU 提高速度。
  • 通过 Dirichlet 正则化实现的稀疏文档-主题成员关系比非稀疏设置产生更连贯的主题并防止主题基础不连贯。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。