Skip to main content
QUICK REVIEW

[论文解读] Representing Mixtures of Word Embeddings with Mixtures of Topic Embeddings

Dongsheng Wang, Dandan Guo|arXiv (Cornell University)|Mar 3, 2022
Topic Modeling被引用 9
一句话总结

本文提出 WeTe,一种新颖的主题建模框架,将文档表示为词嵌入与主题的混合体,并将主题表示为共享语义空间中的可学习嵌入向量。通过使用双向传输方法最小化词嵌入与主题嵌入之间的最优传输成本,WeTe 实现了可扩展的端到端训练,采用随机梯度下降,其在短文本和长文本上的主题一致性、多样性以及文档表征方面均达到当前最优性能,尤其在结合预训练词嵌入时表现更佳。

ABSTRACT

A topic model is often formulated as a generative model that explains how each word of a document is generated given a set of topics and document-specific topic proportions. It is focused on capturing the word co-occurrences in a document and hence often suffers from poor performance in analyzing short documents. In addition, its parameter estimation often relies on approximate posterior inference that is either not scalable or suffers from large approximation error. This paper introduces a new topic-modeling framework where each document is viewed as a set of word embedding vectors and each topic is modeled as an embedding vector in the same embedding space. Embedding the words and topics in the same vector space, we define a method to measure the semantic difference between the embedding vectors of the words of a document and these of the topics, and optimize the topic embeddings to minimize the expected difference over all documents. Experiments on text analysis demonstrate that the proposed method, which is amenable to mini-batch stochastic gradient descent based optimization and hence scalable to big corpora, provides competitive performance in discovering more coherent and diverse topics and extracting better document representations.

研究动机与目标

  • 解决传统主题模型在处理短文档时的局限性以及贝叶斯主题模型与神经主题模型在可扩展性方面的问题。
  • 通过直接优化词嵌入与主题嵌入之间的语义对齐,消除对复杂后验推断或生成建模的依赖。
  • 通过学习在共享向量空间中与词嵌入语义对齐的主题嵌入,提升主题的一致性与多样性。
  • 通过避免迭代推理过程,实现大规模语料的可扩展小批量随机优化。
  • 提升下游任务(如聚类)中文档表征的质量,尤其在短文本上表现更优。

提出的方法

  • 将每篇文档表示为词嵌入上的离散分布,将每个主题表示为同一 H 维嵌入空间中的可学习向量。
  • 采用概率性双向最优传输方法,衡量文档中词嵌入与主题嵌入之间的语义距离,成本基于嵌入相似度。
  • 通过最小化经验词分布与基于主题的混合分布之间的期望传输成本,联合优化主题嵌入与文档主题比例。
  • 通过随机梯度下降结合重参数化技巧实现可扩展训练,避免使用 Gibbs 采样或变分推断。
  • 引入一种混合目标函数,结合传输成本与泊松似然,以平衡主题质量与文档表征。
  • 采用预训练词嵌入作为输入,支持端到端微调,在低资源与短文本场景下实现性能提升。

实验结果

研究问题

  • RQ1一种在共享嵌入空间中直接优化词嵌入与主题嵌入语义对齐的主题模型,是否能在主题一致性与多样性方面超越现有模型?
  • RQ2此类模型是否能在不依赖复杂后验推断或生成假设的前提下,实现对短文本的竞争力性能?
  • RQ3最小化词嵌入与主题嵌入之间的最优传输成本,是否能提升下游聚类任务中的文档表征质量?
  • RQ4传输成本与似然损失的组合如何影响主题质量与表征学习?
  • RQ5该模型能否学习到可解释的、语义一致的主题,且在嵌入空间中呈现空间聚集特性?

主要发现

  • WeTe 在主题一致性与多样性方面达到当前最优性能,每个主题的前 6 个词聚类在 t-SNE 可视化中展现出强语义一致性。
  • 该模型显著提升了文档表征质量,在短文本与常规文本的聚类任务中均优于竞争性基线模型。
  • 通过超参数 ε 调节传输成本与似然之间的权衡,可进一步提升性能,且混合目标函数优于单一组件。
  • 主题嵌入在嵌入空间中分布良好,每个主题作为概念中心,周围聚集了语义相关的词语。
  • 与 NSTM 相比,WeTe 发现了更多样化的主题,尤其在 'desktop' 等查询上,得益于双向传输机制促进了更广泛的语义覆盖。
  • 该模型具备可扩展性,适用于小批量随机优化,可在无需迭代推理的情况下高效训练大规模语料。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。