Skip to main content
QUICK REVIEW

[论文解读] LTSG: Latent Topical Skip-Gram for Mutually Learning Topic Model and Vector Representations

Jarvan Law, Hankz Hankui Zhuo|arXiv (Cornell University)|Feb 23, 2017
Topic Modeling参考文献 20被引用 12
一句话总结

LTSG 提出了一种联合学习框架,通过为多义词引入全局主题表征,利用类似 EM 的迭代优化方法,使主题模型与词嵌入相互提升。该方法在主题一致性与自然语言处理任务中均优于当前最先进方法,主题一致性得分为 -92.23,优于 LDA 的 -108.72。

ABSTRACT

Topic models have been widely used in discovering latent topics which are shared across documents in text mining. Vector representations, word embeddings and topic embeddings, map words and topics into a low-dimensional and dense real-value vector space, which have obtained high performance in NLP tasks. However, most of the existing models assume the result trained by one of them are perfect correct and used as prior knowledge for improving the other model. Some other models use the information trained from external large corpus to help improving smaller corpus. In this paper, we aim to build such an algorithm framework that makes topic models and vector representations mutually improve each other within the same corpus. An EM-style algorithm framework is employed to iteratively optimize both topic model and vector representations. Experimental results show that our model outperforms state-of-art methods on various NLP tasks.

研究动机与目标

  • 解决现有模型依赖预训练主题模型或词嵌入作为固定先验的局限性。
  • 克服多义词导致主题建模与词嵌入质量相互下降的相互依赖问题。
  • 开发一种联合学习框架,同时优化主题模型与向量表征,无需外部先验。
  • 通过主题与词嵌入之间的双向增强,提升主题一致性与下游自然语言处理任务性能。

提出的方法

  • 为每个多义词 $w$ 引入一个全局主题表征 $\bm{T}w$,其由主题-词分布 $\bm{\varphi}$ 和主题嵌入 $\bm{t}$ 推导得出。
  • 扩展 skip-gram 模型,使其在给定词 $w$ 及其全局主题 $\bm{T}w$ 的条件下,最大化上下文概率,实现上下文感知的表征学习。
  • 使用联合目标函数,同时优化词嵌入 $\bm{v}_w$、主题嵌入 $\bm{t}_k$ 和主题-词分布 $\bm{\varphi}$。
  • 采用类似 EM 的算法,迭代优化主题分配 $\bm{z}$、词嵌入、主题嵌入与 $\bm{\varphi}$。
  • 将多义词嵌入表征为词嵌入与主题嵌入的拼接,实现多义表征。
  • 将该框架应用于主题建模与词表示学习,通过迭代优化实现相互提升。

实验结果

研究问题

  • RQ1主题模型与词嵌入能否在不依赖预训练先验的前提下实现联合优化,以相互提升性能?
  • RQ2为多义词引入全局主题表征 $\bm{T}w$ 如何提升主题一致性与词表示质量?
  • RQ3主题模型与向量表征之间的相互学习在多大程度上优于当前最先进模型,从而提升下游自然语言处理任务性能?
  • RQ4该联合优化框架是否能有效减轻多义性对主题建模与词嵌入学习的负面影响?

主要发现

  • LTSG 在 20NewsGroup 数据集上取得 -92.23 的主题一致性得分,显著优于 LDA 的 -108.72,表明生成的主题质量更高、更一致。
  • 定性分析表明,LTSG 生成的主题更具具体性与明确性——例如聚焦于打印机技术与邮件服务器配置,而 LDA 的主题则更泛化,如‘高质量’等属性。
  • 该模型表明主题模型可增强词嵌入,证据来自下游任务性能的提升,验证了相互学习机制的有效性。
  • LTSG 在主题挖掘与文本分类任务中均优于当前最先进模型,证实了联合优化的有效性。
  • 该框架通过全局主题 $\bm{T}w$ 学习主题特定表征,成功捕捉了多义词的多种含义。
  • 迭代式 EM 风格优化有效平衡并精炼了词嵌入、主题嵌入与主题-词分布,实现相互促进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。