[论文解读] Don't Judge a Language Model by Its Last Layer: Contrastive Learning with Layer-Wise Attention Pooling
本文提出逐层注意力池化机制,通过自适应地加权所有层的特征,而非依赖于固定池化策略(如最后一层),以改进预训练语言模型(PLMs)中的句子表示学习。结合对比学习,该方法在语义文本相似性和语义搜索任务上实现了最先进性能,即使在推理时移除注意力层后,仍优于固定池化策略。
Recent pre-trained language models (PLMs) achieved great success on many natural language processing tasks through learning linguistic features and contextualized sentence representation. Since attributes captured in stacked layers of PLMs are not clearly identified, straightforward approaches such as embedding the last layer are commonly preferred to derive sentence representations from PLMs. This paper introduces the attention-based pooling strategy, which enables the model to preserve layer-wise signals captured in each layer and learn digested linguistic features for downstream tasks. The contrastive learning objective can adapt the layer-wise attention pooling to both unsupervised and supervised manners. It results in regularizing the anisotropic space of pre-trained embeddings and being more uniform. We evaluate our model on standard semantic textual similarity (STS) and semantic search tasks. As a result, our method improved the performance of the base contrastive learned BERT_base and variants.
研究动机与目标
- 解决固定池化策略(如最后一层或平均池化)在捕捉PLM各层多样化语言特征方面的局限性。
- 探究逐层注意力池化是否能更好地保留并整合PLM中多层的任务相关信号。
- 在监督和无监督对比学习目标下,评估所提池化策略的有效性。
- 证明该方法可在不增加推理成本的情况下提升语义搜索性能,即使在推理时移除注意力层后依然成立。
- 建立一种与任务无关、可学习的池化机制,其性能优于现有基于InfoNCE的对比学习方法用于句子嵌入。
提出的方法
- 提出一种乘法注意力机制,基于[CLS]标记表示与各层平均标记表示之间的兼容性,计算各层的重要性分数。
- 使用可学习的查询、键和值投影,计算每层的注意力权重αi,实现对层特定特征的动态加权。
- 通过加权求和(公式2)聚合各层的加权表示,随后对加权表示进行全局平均(公式3)。
- 将最后一层的[CLS]表示与聚合的逐层表示拼接,并通过可学习的MLP生成最终的句子嵌入(公式4–5)。
- 在三种对比学习方案中应用该池化策略:基本监督对比学习、自监督对比学习以及混合方法。
- 使用InfoNCE损失函数进行模型训练,使语义相似的句子对更接近,语义不相似的句子对更远离,从而正则化嵌入空间,使其更加均匀且减少各向异性。
实验结果
研究问题
- RQ1可学习的、逐层的注意力池化机制是否能在句子表示学习中超越[CLS]或平均池化等固定池化策略?
- RQ2与标准方法相比,结合逐层注意力池化的对比学习是否能生成更均匀且各向异性更弱的句子嵌入?
- RQ3所提池化策略是否能在不增加推理成本的前提下,提升语义文本相似性(STS)和语义搜索任务的性能?
- RQ4在推理时移除注意力机制后,逐层注意力池化的性能增益是否依然存在?
- RQ5与现有最先进对比学习模型相比,该方法在句子嵌入上的性能如何?
主要发现
- 所提出的结合对比学习的逐层注意力池化方法在STS-B测试集上取得了86.76的Spearman相关系数,优于所有基线固定池化策略,包括[CLS] Last + AVG Last拼接(85.11)。
- 在Quora重复问题数据集上,使用RoBERTa-large训练的模型在逐层注意力池化下实现了MRR@10为66.32,优于基线的65.85,同时保持相同的内存占用并减少了检索时间。
- 即使在推理时移除注意力层,采用逐层注意力池化的模型仍优于基线,证明了所学习表示的有效性。
- 消融实验证明,结合所有层的[CLS]和平均注意力(LayerAttPooler(CLS All + AVG All attention))性能最高(STS-B上为86.57),在与最后一层[CLS]拼接后进一步提升至86.76。
- 该方法降低了嵌入空间的各向异性,并提升了均匀性,这由对比学习目标所证实,从而实现了更好的泛化能力。
- 该模型在相同参数量下实现了更优的语义搜索性能并降低了延迟,表明该方法可实现更高效、更精确的检索。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。