Skip to main content
QUICK REVIEW

[论文解读] Correlation Coefficients and Semantic Textual Similarity

В. К. Железняк, Aleksandar Savkov|arXiv (Cornell University)|May 19, 2019
Topic Modeling参考文献 52被引用 7
一句话总结

本文证明余弦相似度在词嵌入中与皮尔逊相关系数在统计上等价,但当嵌入偏离正态分布时(尤其是GloVe和平均fastText向量)则不适用。本文提出使用非参数等级相关(斯皮尔曼ρ、肯德尔τ)作为替代,显著提升了在语义文本相似度基准上的表现,且简单平均词向量与等级相关方法的表现可媲美使用余弦相似度的最先进深度模型。

ABSTRACT

A large body of research into semantic textual similarity has focused on constructing state-of-the-art embeddings using sophisticated modelling, careful choice of learning signals and many clever tricks. By contrast, little attention has been devoted to similarity measures between these embeddings, with cosine similarity being used unquestionably in the majority of cases. In this work, we illustrate that for all common word vectors, cosine similarity is essentially equivalent to the Pearson correlation coefficient, which provides some justification for its use. We thoroughly characterise cases where Pearson correlation (and thus cosine similarity) is unfit as similarity measure. Importantly, we show that Pearson correlation is appropriate for some word vectors but not others. When it is not appropriate, we illustrate how common non-parametric rank correlation coefficients can be used instead to significantly improve performance. We support our analysis with a series of evaluations on word-level and sentence-level semantic textual similarity benchmarks. On the latter, we show that even the simplest averaged word vectors compared by rank correlation easily rival the strongest deep representations compared by cosine similarity.

研究动机与目标

  • 探究余弦相似度作为文本嵌入相似度度量的统计有效性。
  • 识别由于词向量分布非正态性而导致皮尔逊相关(及余弦相似度)失效的条件。
  • 提出并评估非参数等级相关系数(斯皮尔曼ρ、肯德尔τ)作为语义文本相似度的稳健替代方法。
  • 证明简单平均词向量与等级相关结合可达到或超越使用余弦相似度的复杂深度模型的性能。
  • 为基于嵌入分布特性选择合适相似度度量提供统计基础。

提出的方法

  • 将每个词或句子嵌入视为来自标量随机变量的300个观测样本,以支持统计分析。
  • 建立余弦相似度在成对嵌入向量上与皮尔逊相关系数在数学上的等价性。
  • 使用正态Q-Q图和统计检验评估不同模型(word2vec、fastText、GloVe)嵌入分布的正态性。
  • 当正态性假设被违反时,用斯皮尔曼等级相关(ρ)和肯德尔tau(τ)替代余弦相似度。
  • 在标准STS基准(STS12–STS16)上,使用平均词向量比较余弦相似度与等级相关的性能表现。
  • 应用校正偏差的百分位数自 resampling(BCa)置信区间,评估性能差异的统计显著性。

实验结果

研究问题

  • RQ1余弦相似度是否对所有类型的预训练词嵌入都具有统计合理性?是否存在其失效的条件?
  • RQ2嵌入分布偏离正态性的程度如何?这如何影响皮尔逊相关作为相似度度量的有效性?
  • RQ3当正态性假设被违反时,非参数等级相关系数(斯皮尔曼ρ、肯德尔τ)能否作为余弦相似度的更稳健替代?
  • RQ4简单句子表示(如平均词向量)与等级相关结合,能否超越使用余弦相似度的复杂深度模型?
  • RQ5词嵌入的哪些统计特性解释了不同相似度度量之间的性能差异?

主要发现

  • 余弦相似度在数学上等价于皮尔逊相关系数,仅在嵌入分布近似正态时才具有合理性。
  • 皮尔逊相关(及余弦相似度)在GloVe嵌入和平均fastText向量上表现欠佳,因非正态性和异常值明显。
  • 当嵌入违反正态性时,斯皮尔曼ρ和肯德尔τ在STS任务上显著优于余弦相似度,最高在STS15的tweet-news子任务上提升达13.98分。
  • 即使仅使用平均词向量与等级相关比较,其性能也可媲美使用余弦相似度的最先进深度模型,例如在STS16的抄袭子任务上分别达到76.46 vs. 75.12。
  • 95% BCa置信区间显示,在多个子任务上等级相关带来统计显著的性能提升,例如在STS16的抄袭子任务上提升达12.69–23.74分。
  • 本研究揭示,词嵌入的训练过程(尤其是无监督目标)可能引发非正态性,但其确切原因仍有待完全理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。