[论文解读] Nonparametric Spherical Topic Modeling with Word Embeddings
该论文提出球面HDP(sHDP),一种非参数主题模型,利用冯·莫里斯-费舍尔(vMF)分布对单位球面上的词嵌入进行建模,通过余弦相似度实现语义一致性。通过结合层次狄利克雷过程与随机变分推断,sHDP灵活地发现主题数量,并在20 Newsgroups和NIPS数据集上分别以65.5%和97.5%的提升超越HDP和高斯LDA,实现最先进的主题一致性表现。
Traditional topic models do not account for semantic regularities in language. Recent distributional representations of words exhibit semantic consistency over directional metrics such as cosine similarity. However, neither categorical nor Gaussian observational distributions used in existing topic models are appropriate to leverage such correlations. In this paper, we propose to use the von Mises-Fisher distribution to model the density of words over a unit sphere. Such a representation is well-suited for directional data. We use a Hierarchical Dirichlet Process for our base topic model and propose an efficient inference algorithm based on Stochastic Variational Inference. This model enables us to naturally exploit the semantic structures of word embeddings while flexibly discovering the number of topics. Experiments demonstrate that our method outperforms competitive approaches in terms of topic coherence on two different text corpora while offering efficient inference.
研究动机与目标
- 为解决传统主题模型在捕捉语言语义规律性方面的局限性。
- 将分布性词表示——特别是通过余弦相似度实现的语义一致性——整合到概率主题建模中。
- 开发一种非参数主题模型,能够自动推断主题数量,同时利用方向性词向量结构。
- 通过替换类别或高斯似然函数为适用于词嵌入的方向分布,提升主题一致性。
- 通过在大规模文本语料上使用随机变分推断,实现高效推断。
提出的方法
- 该模型使用冯·莫里斯-费舍尔(vMF)分布作为似然函数,将词向量视为单位球面上的点,主题则表示为方向性均值。
- 每个主题由均值方向 μₖ 和浓度参数 κₖ 表示,vMF密度与 exp(κₖ μₖᵀ xₙ) 成正比(忽略归一化常数)。
- 基础主题模型为层次狄利克雷过程(HDP),支持无限数量主题的非参数推断。
- 采用随机变分推断(SVI)实现对主题分配和参数的可扩展且高效的后验近似。
- 词嵌入被归一化为单位长度,使余弦相似度在vMF框架内自然地成为语义度量。
- 生成过程通过从狄利克雷过程抽取的文档特定主题比例上的分类分布,将每个词分配给一个主题。
实验结果
研究问题
- RQ1冯·莫里斯-费舍尔分布能否有效将词嵌入作为方向数据建模,以提升主题一致性?
- RQ2用方向似然函数替代类别或高斯似然函数,是否能增强主题建模中的语义一致性?
- RQ3像HDP这样的非参数贝叶斯模型能否有效适配vMF,以处理连续词嵌入?
- RQ4所提出的方法在保持高效推断的同时,是否在主题一致性方面优于现有主题模型?
- RQ5在vMF似然中使用余弦相似度与在高斯LDA中使用欧氏距离相比,对主题建模有何影响?
主要发现
- 在NIPS数据集上,sHDP的主题一致性得分为0.442,较高斯LDA(k=100)高出0.174分,较HDP高出0.172分。
- 在20 Newsgroups数据集上,sHDP的相干性为0.162,较高斯LDA(k=100)提升97.5%,较HDP提升65.5%。
- sHDP在NIPS数据集上自动发现92个主题,在20 Newsgroups上发现16个主题,展示了无需人工设定k值的主题自动发现能力。
- 通过表1中的关键词分析,模型生成的主题在定性上一致且语义连贯。
- 随机变分推断实现更快收敛:sHDP约五轮内即收敛,而高斯LDA需显著更长时间。
- 归一化对数似然图显示,sHDP的收敛速度明显快于高斯LDA,表明其推断效率更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。