QUICK REVIEW
[论文解读] word2vec Skip-Gram with Negative Sampling is a Weighted Logistic PCA
Andrew J. Landgraf, Jeremy Bellay|arXiv (Cornell University)|May 27, 2017
Topic Modeling参考文献 7被引用 13
一句话总结
本文证明了带有负采样的 skip-gram 模型(SGNS)在数学上等价于加权逻辑主成分分析(PCA),其中词-上下文对被建模为基于共现频率和负采样率的加权二项分布试验。其主要贡献在于提出了一个统一的概率解释,将 SGNS 与指数族 PCA 关联起来,从而深化了对 SGNS 的理解,便于与 GloVe 等其他方法进行比较,并可扩展至高阶张量分解。
ABSTRACT
We show that the skip-gram formulation of word2vec trained with negative sampling is equivalent to a weighted logistic PCA. This connection allows us to better understand the objective, compare it to other word embedding methods, and extend it to higher dimensional models.
研究动机与目标
- 阐明广泛使用但概率解释尚不清晰的带有负采样的 skip-gram(SGNS)模型的潜在统计机制。
- 建立 SGNS 与指数族 PCA(特别是具有二项分布似然的加权逻辑 PCA)之间的正式联系。
- 为 SGNS 提供一个基于原理的解释,阐明其隐式正则化和加权方案的成因。
- 通过统一的概率框架,使 SGNS 能够与 GloVe 及基于矩阵分解的方法进行比较。
- 通过张量分解方法,将 SGNS 扩展至更高维模型,包括联合学习文档、词和上下文向量。
提出的方法
- 本文将 SGNS 目标函数推导为一个加权对数似然最大化问题,其中响应变量为观察到的词-上下文对的比例,权重为每对的总机会数。
- 证明 SGNS 目标函数等价于最大化一个加权逻辑 PCA 目标,其中响应变量 $ x_{w,c} = \frac{P_D(w,c)}{P_D(w,c) + kP_D(w)P_D(c)} $,权重为 $ n_{w,c} + k n_w P_D(c) $。
- 该方法将负采样解释为生成具有 $ n_{w,c} $ 次成功和 $ k n_w P_D(c) $ 次失败的二项分布试验,从而得到对数优势比的最大似然估计。
- 将 SGNS 目标函数重新表达为逻辑 PCA 对数似然形式,表明其等价于 $ \sum_{w,c} w_{w,c} (x_{w,c} \theta_{w,c} - \log(1 + \exp(\theta_{w,c}))) $,其中 $ \theta_{w,c} = \mathbf{v}_w^T \mathbf{v}_c $。
- 提出一种基于加权最小二乘法的替代方法 SGNS-LS,可能在计算效率上优于 GloVe 的加权方案,并具有概念优势。
- 建议通过引入文档级向量,将 SGNS 扩展至高阶张量分解,类似于 Cotterell 等人(2017)的工作。
实验结果
研究问题
- RQ1是否存在一种概率解释,能够说明 skip-gram 带负采样(SGNS)的优化目标,而不仅依赖于经验成功?
- RQ2负采样过程与二项分布或逻辑回归模型有何关联?
- RQ3SGNS 能否与现有的矩阵分解或 PCA 方法(特别是指数族框架下的方法)建立正式联系?
- RQ4该联系对模型比较(尤其是与 GloVe 及其他嵌入方法的比较)有何启示?
- RQ5SGNS 框架能否扩展至包含更高阶因子(如文档向量)的张量分解设置?
主要发现
- SGNS 在数学上等价于具有二项分布似然的加权逻辑 PCA,其中响应变量为观察到的词-上下文共现比例,权重反映了总的机会数。
- SGNS 中的加权方案通过增加负样本的有效数量,对稀有共现对施加了隐式正则化,$ k $ 越大,低频对的影响越小。
- 估计概率 $ x_{w,c} $ 的对数优势比对应于 $ \text{PMI}(w,c) - \log k $,在统一的概率解释下,恢复了 Levy 和 Goldberg(2014)的结果。
- 所提出的加权逻辑 PCA 框架在概念上优于 GloVe 的加权方案,因为它考虑了边缘频率,并更准确地反映了稀有共现的概率。
- 提出了一种基于加权最小二乘法的替代方法 SGNS-LS,可能在计算上更具优势,并且与 Spotify 的逻辑矩阵分解等协同过滤方法更一致。
- 与指数族 PCA 的联系使得 SGNS 可以扩展至更高阶模型,例如通过张量分解实现文档、词和上下文向量的联合学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。