[论文解读] Comparing in context: Improving cosine similarity measures with a metric tensor
本文提出一种上下文感知的度量张量,通过学习上下文特定的内积来增强余弦相似度,从而在不修改预训练嵌入的情况下提升词相似度相关性。该方法在上下文嵌入模型(如 BERT)上取得了显著性能提升,展现出对未见数据集的良好泛化能力,并通过学习到的动态相似度度量提升了可解释性。
Cosine similarity is a widely used measure of the relatedness of pre-trained word embeddings, trained on a language modeling goal. Datasets such as WordSim-353 and SimLex-999 rate how similar words are according to human annotators, and as such are often used to evaluate the performance of language models. Thus, any improvement on the word similarity task requires an improved word representation. In this paper, we propose instead the use of an extended cosine similarity measure to improve performance on that task, with gains in interpretability. We explore the hypothesis that this approach is particularly useful if the word-similarity pairs share the same context, for which distinct contextualized similarity measures can be learned. We first use the dataset of Richie et al. (2020) to learn contextualized metrics and compare the results with the baseline values obtained using the standard cosine similarity measure, which consistently shows improvement. We also train a contextualized similarity measure for both SimLex-999 and WordSim-353, comparing the results with the corresponding baselines, and using these datasets as independent test sets for the all-context similarity measure learned on the contextualized dataset, obtaining positive results for a number of tests.
研究动机与目标
- 通过用可学习的度量张量替代余弦相似度中的标准欧几里得内积,提升词相似度评估性能。
- 探究在上下文化词对数据集上学习的上下文特定相似度度量是否优于静态基线方法。
- 实现学习到的相似度度量在无关数据集上的泛化能力,测试其在不同词对上下文间的可迁移性。
- 通过将度量学习与嵌入微调解耦,提升相似度计算的可解释性和效率。
- 探索将学习到的度量集成到组合分布语义学和张量收缩框架中的可能性。
提出的方法
- 引入使用对称正定度量张量 G 的广义余弦相似度,将标准欧几里得内积替换为 ⟨u,v⟩_G = u^T G v。
- 通过优化与人工标注分数的相关性,在上下文化词对相似度数据集(如上下位关系)上学习度量张量 G。
- 在统一的上下位词数据集(如 'Birds', 'Fishes')上训练度量张量,以捕捉跨上下文的相似性模式。
- 将学习到的度量应用于独立测试集(如 SimLex-999, WordSim-353),评估零样本泛化性能。
- 使用相同的预训练嵌入(如 BERT, GPT-2, Word2Vec)对比标准余弦相似度与度量张量增强版本的性能表现。
- 采用皮尔逊相关系数和斯皮尔曼等级相关系数作为评估指标,衡量相对于基线模型的性能提升。
实验结果
研究问题
- RQ1在不微调词嵌入的前提下,上下文感知的度量张量是否能提升余弦相似度在词相似度基准上的性能?
- RQ2在上下文化数据集(如上下位词)上学习度量是否比在无关词对(如 WS353, SL999)上学习具有更好的泛化能力?
- RQ3在一组词对上学习的度量在泛化到无关的独立数据集(如 SimLex-999 和 WordSim-353)时,其性能提升的幅度有多大?
- RQ4在不同预训练嵌入模型(如 BERT, GPT-2, Word2Vec)上,度量张量方法的性能表现如何比较?
- RQ5模型架构和上下文多样性对学习到的度量张量的稳定性和可解释性有何影响?
主要发现
- 在使用 BERT 嵌入时,该方法在 SimLex-999 和 WordSim-353 上显著提升了相关性得分,皮尔逊相关系数达到 0.487,斯皮尔曼等级相关系数达到 0.519,相较基线值(0.239 和 0.267)有显著提升。
- 在所有上下位词上联合训练的最佳模型在独立数据集上泛化良好,在 BERT 上对 SimLex-999 的相关性提升了 100%(0.375 vs. 0.151 的基线)。
- 上下文化表示(如 BERT)在度量学习后表现出最高的相对性能提升,SimLex-999 上相关性提升 100%,表明上下文信息在嵌入和相似度度量中具有累积增益。
- 在所有上下位词上训练的模型优于针对单个上下位词训练的模型,表明在训练中接触多样化上下文有助于提升泛化能力和迁移学习性能。
- 当使用最佳模型时,该方法在 SimLex-999(皮尔逊相关系数 0.658)和 WordSim-353(皮尔逊相关系数 0.704)上达到了当前最优性能,超越了以往的 SOTA 结果。
- 在学习到的度量下,词向量的分布变得更加共线且更集中,表明该度量有效对齐了向量空间中的语义关系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。