Skip to main content
QUICK REVIEW

[论文解读] Effects of High-Order Co-occurrences on Word Semantic Similarities

Benoı̂t Lemaire, Guy Denhière|ArXiv.org|Apr 1, 2008
Topic Modeling参考文献 21被引用 22
一句话总结

本文提出一种计算模型,模拟词语意义如何通过接触文本而浮现,重点关注高阶共现对语义相似性的影响。结果表明,尽管直接共现会显著提升感知到的相似性,但高阶共现(例如,与其他词语共享语境)仍具有较小但可测量的正向影响,暗示基于频率的相似性度量可能因仅依赖共现频率而高估语义相关性。

ABSTRACT

A computational model of the construction of word meaning through exposure to texts is built in order to simulate the effects of co-occurrence values on word semantic similarities, paragraph by paragraph. Semantic similarity is here viewed as association. It turns out that the similarity between two words W1 and W2 strongly increases with a co-occurrence, decreases with the occurrence of W1 without W2 or W2 without W1, and slightly increases with high-order co-occurrences. Therefore, operationalizing similarity as a frequency of co-occurrence probably introduces a bias: first, there are cases in which there is similarity without co-occurrence and, second, the frequency of co-occurrence overestimates similarity.

研究动机与目标

  • 建模词语意义如何通过接触文本输入而构建。
  • 研究高阶共现对词语之间感知语义相似性的影响。
  • 评估基于频率的相似性度量是否在语义相似性估计中引入偏差。
  • 模拟在文本流中逐段推进的语义相似性发展过程。

提出的方法

  • 在文本上逐段增量训练计算模型,追踪词语共现模式。
  • 语义相似性被操作化为基于共现频率的联想强度。
  • 模型区分直接共现(W1 和 W2 同时出现)与高阶共现(与其它词语共享语境,例如 W1 和 W2 均与 W3 共现)。
  • 使用频率加权的关联度量计算相似性,并对未配对出现情况进行调整。
  • 模型在处理新文本时评估相似性的变化,追踪共现模式的演变。
  • 高阶共现通过共享语境邻居建模,而非直接词语对。

实验结果

研究问题

  • RQ1两个词语之间的直接共现如何影响其感知语义相似性?
  • RQ2高阶共现(共享语境)在直接共现之外对语义相似性的贡献有多大?
  • RQ3由于共现偏差,基于频率的相似性估计是否会高估实际的语义相关性?
  • RQ4随着文本逐段处理,语义相似性如何逐步演变?

主要发现

  • 两个词语之间的直接共现会显著提升其感知语义相似性。
  • 当一个词语出现而另一个未出现时(即未配对出现),会降低两者的感知相似性。
  • 高阶共现——如两个词语均与第三个词语共现于同一语境——对相似性产生微小但显著的正向影响。
  • 本研究识别出基于频率的相似性度量存在系统性偏差:它们因过度强调共现频率,即使在无直接关联的情况下也高估语义相似性。
  • 存在词语之间真实的语义相似性,但并未共现,表明仅靠共现频率无法完整衡量语义相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。