Skip to main content
QUICK REVIEW

[论文解读] SBERT-WK: A Sentence Embedding Method by Dissecting BERT-based Word Models

Bin Wang, C.‐C. Jay Kuo|arXiv (Cornell University)|Feb 16, 2020
Topic Modeling参考文献 50被引用 14
一句话总结

SBERT-WK 提出了一种新颖的句子嵌入方法,通过分析 BERT 基础模型中多个层的词表示所张成的子空间的几何结构,提取并融合具有信息量的词表示。该方法无需进一步微调,即可通过利用层间模式和显著的词表示,在语义文本相似性及下游 NLP 任务上实现最先进性能,优于 SBERT 和 BERT 等现有方法。

ABSTRACT

Sentence embedding is an important research topic in natural language processing (NLP) since it can transfer knowledge to downstream tasks. Meanwhile, a contextualized word representation, called BERT, achieves the state-of-the-art performance in quite a few NLP tasks. Yet, it is an open problem to generate a high quality sentence representation from BERT-based word models. It was shown in previous study that different layers of BERT capture different linguistic properties. This allows us to fusion information across layers to find better sentence representation. In this work, we study the layer-wise pattern of the word representation of deep contextualized models. Then, we propose a new sentence embedding method by dissecting BERT-based word models through geometric analysis of the space spanned by the word representation. It is called the SBERT-WK method. No further training is required in SBERT-WK. We evaluate SBERT-WK on semantic textual similarity and downstream supervised tasks. Furthermore, ten sentence-level probing tasks are presented for detailed linguistic analysis. Experiments show that SBERT-WK achieves the state-of-the-art performance. Our codes are publicly available.

研究动机与目标

  • 为解决从预训练 BERT 基础模型生成高质量句子表示这一开放问题。
  • 探究在 BERT 等深度上下文表示模型中,词表示如何随层演化。
  • 开发一种无需训练的句子嵌入方法,有效融合多层信息。
  • 在语义相似性和下游 NLP 任务上评估所提方法的可解释性与性能。

提出的方法

  • 该方法使用奇异值分解(SVD)和 QR 分解,分析 BERT 各层中词表示空间的几何结构。
  • 通过测量词表示在各层间的变异程度,识别出显著的词表示,变异程度越高,表示越具信息量。
  • 采用基于窗口的聚合策略,将选定范围内的层的表示进行组合,窗口大小默认为 m=2,起始层为 l_S=4。
  • 最终的句子嵌入通过加权平均选定的词表示计算得出,权重由子空间的几何结构推导而来。
  • 该方法兼容多种 BERT 基础模型(包括 RoBERTa),且无需额外微调。
  • 采用两阶段流程:首先,子空间分析识别出具有信息量的层和词;其次,使用鲁棒的聚合方法融合选定的表示。

实验结果

研究问题

  • RQ1在 BERT 基础模型中,词表示如何随层演化?哪些模式与语言信息量相关?
  • RQ2对词表示所张成的子空间进行几何分析,能否提升句子嵌入的质量?
  • RQ3层的选择和窗口大小如何影响下游任务中句子嵌入的性能?
  • RQ4无需训练的方法能否在语义文本相似性和下游 NLP 任务上超越微调的句子嵌入模型(如 SBERT)?
  • RQ5通过探针任务揭示,SBERT-WK 生成的句子表示中编码了哪些语言属性?

主要发现

  • 在 STS-B 基准上,SBERT-WK 达到 74.21 的皮尔逊相关系数,优于 SBERT(73.14)和基于 BERT 的基线方法。
  • 在 SICK-E 数据集上,SBERT-WK 达到 91.67% 的测试准确率,比次佳基线高出超过 1.5 个百分点。
  • 该方法对超参数选择具有鲁棒性:在不同窗口大小(m=1 至 4)和起始层选择(l_S=0 至 6)下,性能保持稳定。
  • SBERT-WK 的推理时间仅比 BERT 在 CPU 上高出 5%,每样本总耗时为 179.27ms,计算效率高。
  • 句子级探针任务表明,SBERT-WK 成功捕捉了句法、语义和形态等多种语言属性。
  • 几何分析表明,跨层表示变异程度更高的词更具信息量,验证了该方法的核心假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。