Skip to main content
QUICK REVIEW

[论文解读] Coherence-Aware Neural Topic Modeling

Ran Ding, Ramesh Nallapati|arXiv (Cornell University)|Sep 7, 2018
Topic Modeling参考文献 17被引用 6
一句话总结

本文提出 NTM-R,一种神经主题模型,通过使用预训练词嵌入对 NPMI 构造可微分代理,将主题一致性整合到训练过程中。通过同时优化困惑度与一致性,NTM-R 在保持困惑度损失最小的同时,显著提升了主题一致性(NPMI),在 DailyKOS、NIPS 和 NYTimes 等多个数据集上优于基线模型。

ABSTRACT

Topic models are evaluated based on their ability to describe documents well (i.e. low perplexity) and to produce topics that carry coherent semantic meaning. In topic modeling so far, perplexity is a direct optimization target. However, topic coherence, owing to its challenging computation, is not optimized for and is only evaluated after training. In this work, under a neural variational inference framework, we propose methods to incorporate a topic coherence objective into the training process. We demonstrate that such a coherence-aware topic model exhibits a similar level of perplexity as baseline models but achieves substantially higher topic coherence.

研究动机与目标

  • 为解决主题建模中仅优化困惑度而一致性仅在训练后评估的差距。
  • 开发一种可微分、可训练的一致性目标,可集成至神经变分推断框架中。
  • 在不牺牲文档重构性能(困惑度)的前提下,提升主题的可解释性。
  • 在涵盖多种文本数据集的场景下,验证基于词嵌入的主题一致性正则化的有效性。

提出的方法

  • 提出一种 NPMI 的可微分代理,称为 WETC(基于词嵌入的主题一致性),利用词嵌入之间的余弦相似度来近似互信息项。
  • 引入 NTM-R,一种神经主题模型,将 WETC 作为正则化项加入 ELBO 目标函数,实现对困惑度与一致性的联合优化。
  • 使用预训练的 GloVe 词嵌入计算 WETC,利用语义相似度近似 NPMI,避免不可微分的查表操作。
  • 采用因子分解约束(NTM-F),通过词嵌入对主题-词矩阵施加约束,隐式促进一致性。
  • 在 NTM-FR 中结合正则化与因子分解方法,在保持训练稳定性的同时进一步提升一致性。
  • 使用 Adadelta 优化器进行模型训练,固定超参数,包括一致性正则化系数 λ = 50。

实验结果

研究问题

  • RQ1是否能在神经主题模型的训练过程中有效优化主题一致性,而非仅在训练后评估?
  • RQ2是否可基于词嵌入构建 NPMI 的可微分近似,以支持端到端训练?
  • RQ3引入一致性感知正则化是否能在不降低困惑度性能的前提下提升主题可解释性?
  • RQ4所提出方法在具有不同词汇量大小与文档类型的多样化文本数据集上是否具有良好的泛化能力?

主要发现

  • NTM-R 在 NPMI 主题一致性方面显著优于基线模型(如 NTM、NVDM、GSM 和 ProdLDA),同时保持相似或更优的困惑度水平。
  • 在 DailyKOS、NIPS 和 NYTimes 数据集上,NTM-R 在相同困惑度水平下持续提升 NPMI,表明其在不同领域间的良好泛化能力。
  • 尽管 WETC 显著提升,NYTimes 数据集的 NPMI 改进微弱,可能由于命名实体比例过高导致 NPMI 评分失真。
  • NTM-F 与 NTM-FR 初始 NPMI 较高,但在训练过程中无法维持,最终收敛至高困惑度,表明参数空间减小导致训练不稳定。
  • NTM-R 位于困惑度与 NPMI 的帕累托前沿,相较于其他神经主题模型,在性能谱的大部分区域均展现出更优的权衡。
  • 基于 WETC 的正则化方法在多种数据集上均有效,验证了其鲁棒性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。