Skip to main content
QUICK REVIEW

[论文解读] SemGloVe: Semantic Co-occurrences for GloVe from BERT

Leilei Gan, Zhiyang Teng|arXiv (Cornell University)|Dec 30, 2020
Topic Modeling被引用 5
一句话总结

本文提出 SemGloVe,一种通过蒸馏 BERT 的语义共现信息来增强 GloVe 词嵌入的方法,利用自注意力权重或掩码语言模型输出概率来生成更具语义相关性的共现计数。实验表明,SemGloVe 在词相似度和下游 NLP 任务上均优于 GloVe,通过捕捉更广泛、更有意义的词对关系,实现了更优的聚类效果和准确率,突破了局部窗口的限制。

ABSTRACT

GloVe learns word embeddings by leveraging statistical information from word co-occurrence matrices. However, word pairs in the matrices are extracted from a predefined local context window, which might lead to limited word pairs and potentially semantic irrelevant word pairs. In this paper, we propose SemGloVe, which distills semantic co-occurrences from BERT into static GloVe word embeddings. Particularly, we propose two models to extract co-occurrence statistics based on either the masked language model or the multi-head attention weights of BERT. Our methods can extract word pairs without limiting by the local window assumption and can define the co-occurrence weights by directly considering the semantic distance between word pairs. Experiments on several word similarity datasets and four external tasks show that SemGloVe can outperform GloVe.

研究动机与目标

  • 为解决 GloVe 基于局部窗口的共现计数方法所导致的词对发现受限及启发式距离函数的问题。
  • 通过用来自 BERT 的语义相关性替代统计共现计数,提升全局词共现矩阵的质量。
  • 生成保留上下文化 BERT 表示中丰富语义信息的静态非上下文词嵌入。
  • 评估基于 BERT 的语义共现是否能在内在任务(如词相似度)和外在任务(如 POS 标注、命名实体识别)中带来性能提升。

提出的方法

  • SemGloVe 使用 BERT 的多头自注意力权重作为语义相似度度量,定义词对之间的共现得分,替代 GloVe 中基于位置的距离函数。
  • 第一种模型 SemGloVe sd 基于注意力权重提取 top-k 上下文词,并使用注意力得分作为权重构建共现矩阵。
  • 第二种模型 SemGloVe md 在 BERT 中掩码目标词,并利用掩码标记预测的输出 logits 作为共现权重,从而实现超越局部窗口的全局上下文捕捉。
  • 引入基于除法的距离函数,将注意力权重或 MLM 输出概率归一化并缩放为有效的共现权重。
  • 最终得到的共现矩阵通过 GloVe 的目标函数进行分解,以学习静态词嵌入。
  • 该方法支持子词级别的共现计数,通过子词配对(如 'egyptologist' 与 'egypt' 和 'archaeologist')丰富语义表征。

实验结果

研究问题

  • RQ1BERT 的上下文表示能否被有效蒸馏为全局共现矩阵,以改进静态词嵌入?
  • RQ2将 GloVe 的基于位置的距离函数替换为 BERT 的注意力权重或 MLM 输出概率,是否能产生更具语义意义的共现计数?
  • RQ3SemGloVe 是否能发现因局部窗口限制而被 GloVe 遗漏的相关词对?
  • RQ4与 GloVe 相比,SemGloVe 在内在词相似度任务和外在 NLP 任务上是否表现更优?
  • RQ5SemGloVe 的不同组件(如注意力 vs. MLM、窗口大小)如何影响最终嵌入质量?

主要发现

  • SemGloVe 在词相似度数据集上的表现优于 GloVe,其中 SemGloVe md 取得最佳结果,表明基于 BERT 的共现信息能显著提升语义表征质量。
  • 该模型成功捕捉到 GloVe 因局部窗口限制而遗漏的语义相关词对,如 'king-crown' 和 'himself-one'。
  • SemGloVe md 对语义相关词对的共现计数显著更高——例如 'egyptologist-egyptian' 达 8.58×10³,远超 GloVe 的 11.32,表明其蕴含更丰富的语义信号。
  • t-SNE 可视化显示,SemGloVe md 生成的词类聚类更紧密、更具可分性(如城市、时间、政治类),而 GloVe 的聚类则呈现散乱的离群点。
  • 消融实验表明,减小 SemGloVe md 的窗口大小会降低性能,而 SemGloVe sd 在更大上下文(10 个词)下仍优于 GloVe,表明其对窗口大小具有鲁棒性。
  • SemGloVe sdR(将 SemGloVe sd 的计数替换为 GloVe 的计数)的性能几乎与 GloVe 一致,证实性能提升源于语义共现机制,而非窗口大小本身。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。