Skip to main content
QUICK REVIEW

[论文解读] Towards a Better Understanding of Predict and Count Models

S. Sathiya Keerthi, Tobias Schnabel|arXiv (Cornell University)|Nov 6, 2015
Topic Modeling参考文献 8被引用 4
一句话总结

本文对基于预测的词嵌入模型(如SGNS)与基于计数的模型(如PMI)之间的关系进行了严格分析,揭示了在特定条件下SGNS等价于一种偏移的PMI模型。研究识别出关键的优化差异——预测模型中的降维可减少过拟合——并提出了一种新型凸的、可解释的词嵌入模型,该模型对L1/L2正则化具有闭式解。

ABSTRACT

In a recent paper, Levy and Goldberg pointed out an interesting connection between prediction-based word embedding models and count models based on pointwise mutual information. Under certain conditions, they showed that both models end up optimizing equivalent objective functions. This paper explores this connection in more detail and lays out the factors leading to differences between these models. We find that the most relevant differences from an optimization perspective are (i) predict models work in a low dimensional space where embedding vectors can interact heavily; (ii) since predict models have fewer parameters, they are less prone to overfitting. Motivated by the insight of our analysis, we show how count models can be regularized in a principled manner and provide closed-form solutions for L1 and L2 regularization. Finally, we propose a new embedding model with a convex objective and the additional benefit of being intelligible.

研究动机与目标

  • 澄清基于预测的模型(例如SGNS)与基于计数的模型(例如PMI)在词表示学习中的理论关系。
  • 识别并分析这些模型之间的关键优化差异,特别是关于维度与过拟合的问题。
  • 通过系统分析,实现对基于PMI的计数模型的合理正则化。
  • 提出一种基于CBOW的新凸词嵌入模型,具备可解释性与闭式解。
  • 通过统一其理论基础,弥合传统分布模型与现代神经预测模型之间的差距。

提出的方法

  • 在共现对称且上下文向量固定的前提下,推导出SGNS与偏移PMI模型之间的等价性。
  • 将SGNS的目标函数重新表述为基于共现的优化问题,从而实现显式解的推导。
  • 通过引入L1和L2惩罚项,将正则化引入PMI模型,并为两者推导出闭式解。
  • 提出一种基于CBOW的新凸词嵌入模型,具备可解释的向量表示。
  • 使用one-hot向量或词袋特征作为上下文表示,使词向量各分量可直接解释。
  • 采用负采样或Softmax进行训练,新模型可通过累积共现统计量实现闭式更新。

实验结果

研究问题

  • RQ1在共现对称假设下,SGNS与PMI模型的目标函数在数学上如何关联?
  • RQ2SGNS与PMI模型之间的关键优化差异是什么,特别是关于维度与过拟合的问题?
  • RQ3是否可以系统地将正则化应用于基于PMI的模型?L1与L2惩罚的闭式解是什么?
  • RQ4能否构建一种凸的、可解释的词嵌入模型,同时保留基于计数与基于预测模型的优势?
  • RQ5所提出的模型如何在保持可解释性的同时,捕捉词表示中的高阶交互关系?

主要发现

  • 当上下文向量固定为one-hot表示且共现矩阵对称时,SGNS在数学上等价于一种偏移的PMI模型。
  • SGNS相对于PMI的主要优化优势在于其使用低维嵌入,从而因参数更少而减少过拟合。
  • PMI模型可通过L1与L2惩罚正则化,且为两者推导出闭式解,从而提升泛化能力。
  • 提出了一种基于CBOW的新凸词嵌入模型,其可解释的词向量中每个分量均直接对应一个上下文词项。
  • 所提出的模型可通过约束与正则化直接整合领域知识,为可解释性与建模能力之间提供了折中方案。
  • 分析表明,PMI模型中词向量与上下文向量之间缺乏交互作用,是其与SGNS的关键结构性差异;而在SGNS中,联合优化可生成更丰富的表示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。