Skip to main content
QUICK REVIEW

[论文解读] Why So Down? The Role of Negative (and Positive) Pointwise Mutual Information in Distributional Semantics

Alexandre Salle, Aline Villavicencio|arXiv (Cornell University)|Aug 19, 2019
Bayesian Modeling and Causal Inference被引用 9
一句话总结

本文研究了分布语义中负点互信息(PMI)与正点互信息(PMI)的作用,提出了新颖的PMI变体,并表明正PMI同时捕捉语义与句法信息,而负PMI主要贡献于句法。本研究通过证明保留负PMI尺度的模型与广泛使用的PPMI(正PMI)方法性能几乎完全一致,为PPMI方法提供了理论依据,并揭示负PMI编码了隐含的句法约束,支持了修正后的分布假说:'一个词由它所共现的词以及它所排斥的词来定义。'

ABSTRACT

In distributional semantics, the pointwise mutual information ($\\mathit{PMI}$) weighting of the cooccurrence matrix performs far better than raw counts. There is, however, an issue with unobserved pair cooccurrences as $\\mathit{PMI}$ goes to negative infinity. This problem is aggravated by unreliable statistics from finite corpora which lead to a large number of such pairs. A common practice is to clip negative $\\mathit{PMI}$ ($\\mathit{\ exttt{-} PMI}$) at $0$, also known as Positive $\\mathit{PMI}$ ($\\mathit{PPMI}$). In this paper, we investigate alternative ways of dealing with $\\mathit{\ exttt{-} PMI}$ and, more importantly, study the role that negative information plays in the performance of a low-rank, weighted factorization of different $\\mathit{PMI}$ matrices. Using various semantic and syntactic tasks as probes into models which use either negative or positive $\\mathit{PMI}$ (or both), we find that most of the encoded semantics and syntax come from positive $\\mathit{PMI}$, in contrast to $\\mathit{\ exttt{-} PMI}$ which contributes almost exclusively syntactic information. Our findings deepen our understanding of distributional semantics, while also introducing novel $PMI$ variants and grounding the popular $PPMI$ measure.

研究动机与目标

  • 理解负PMI在分布语义中的作用,特别是共现矩阵低秩矩阵分解中的作用。
  • 评估将负PMI压缩为零(如PPMI中所做)是否会导致信息丢失,或是否在性能上具有合理性。
  • 调查负PMI是否对语义任务有实质性贡献,还是主要反映句法信息。
  • 提出新的PMI变体,以涵盖负PMI值的完整谱系。
  • 将Firth的分布假说扩展,纳入负共现模式作为词表示的有用信息。

提出的方法

  • 使用对称滑动窗口从子采样语料中构建共现矩阵。
  • 使用公式计算标准PMI:PMI(w,c) = log(M_wc * M_** / (M_w* * M_*c))。
  • 提出截断PMI(CPMI_z)作为max(z, PMI(w,c))以处理负值,其中当z=0时即为PPMI的特例。
  • 引入两种新颖的PMI变体:NNEGPMI(归一化负PMI)和NPMI(归一化PMI),以分别处理负谱和正谱的尺度问题。
  • 对变换后的矩阵(如PPMI、CPMI_z、NNEGPMI)进行低秩加权分解,以生成稠密词嵌入。
  • 在语义(SimLex、RW、类比)、句法(词性标注、依存句法分析、拓扑聚类)和语义相似性任务上评估模型。

实验结果

研究问题

  • RQ1与正PMI相比,负PMI编码了何种类型的语言信息?
  • RQ2将负PMI压缩为零(如PPMI中所做)是否在语义和句法任务上导致显著性能损失?
  • RQ3负PMI能否改善罕见词的表示,特别是在类比任务中?
  • RQ4与截断或归一化相比,保留负PMI值的尺度对模型性能有何影响?
  • RQ5负PMI在多大程度上反映句法约束而非语义内容?

主要发现

  • 仅使用正PMI的模型在几乎所有语义和句法任务上的表现与完整谱系模型相当或更优,表明其同时编码了语义与句法信息。
  • 负PMI在语义任务上表现较差(如SimLex:30.5–34.7斯皮尔曼等级相关;RW:16.6–30.5%),但在词性标注(88.8–92.6%)和依存句法分析(32.4–34.7%)任务上表现匹配或优于其他模型,证实其句法特异性。
  • PPMI模型(将负PMI截断为零)在性能上与保留负PMI尺度的模型(如CPMI_-2:词性标注92.6%,WC任务31.1%)几乎完全一致,从而为PPMI的广泛应用提供了合理性。
  • 保留正PMI尺度的模型(如CPMI_-2、NNEGPMI)优于未保留尺度的模型(如NPMI),表明尺度对语义更重要,而对句法影响较小。
  • 负PMI几乎完全贡献于句法泛化,表明其编码了从未观察到的共现模式中的隐含语法约束。
  • 完整谱系模型(如PPMI)整体表现最佳,但仅因正PMI占主导;负PMI对语义贡献极小,但可能通过排斥无关词而有助于罕见词类比。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。