[论文解读] Sentence Embeddings using Supervised Contrastive Learning
该论文提出了一种监督对比学习方法,通过在SNLI数据上微调BERT,结合交叉熵损失和对比损失,以提升句子嵌入质量。该方法实现了最先进性能,在STS基准测试中平均得分提升2.8%,在迁移任务中相比SBERT提升1.05%,且仅增加16分钟训练开销。
Sentence embeddings encode sentences in fixed dense vectors and have played an important role in various NLP tasks and systems. Methods for building sentence embeddings include unsupervised learning such as Quick-Thoughts and supervised learning such as InferSent. With the success of pretrained NLP models, recent research shows that fine-tuning pretrained BERT on SNLI and Multi-NLI data creates state-of-the-art sentence embeddings, outperforming previous sentence embeddings methods on various evaluation benchmarks. In this paper, we propose a new method to build sentence embeddings by doing supervised contrastive learning. Specifically our method fine-tunes pretrained BERT on SNLI data, incorporating both supervised crossentropy loss and supervised contrastive loss. Compared with baseline where fine-tuning is only done with supervised cross-entropy loss similar to current state-of-the-art method SBERT, our supervised contrastive method improves 2.8% in average on Semantic Textual Similarity (STS) benchmarks and 1.05% in average on various sentence transfer tasks.
研究动机与目标
- 通过在监督对比学习中利用标签信息,提升句子嵌入质量。
- 探究在微调过程中同时使用交叉熵损失和对比损失是否能增强语义表征学习。
- 评估监督对比学习在句子级迁移任务和无监督STS基准上的有效性。
- 分析对比目标中超参数(λ、温度、正样本/负样本采样)的敏感性。
- 与现有微调基线相比,展示所提方法的计算效率。
提出的方法
- 在SNLI数据上微调BERT,采用双重目标:标准交叉熵损失和监督对比损失。
- 通过在两个BERT编码器之间共享权重,计算锚点、正样本和负样本对的句子嵌入。
- 应用一种对比损失,使正样本嵌入在嵌入空间中更接近,负样本嵌入更远离。
- 使用温度缩放的softmax计算对比损失,对温度τ进行超参数调优。
- 采用交叉熵损失和对比损失的加权组合,通过超参数λ控制两者之间的平衡。
- 从SNLI训练批次中为每个锚点采样所有可用的正样本和负样本,以最大化对比信号。
实验结果
研究问题
- RQ1在BERT微调过程中引入监督对比学习是否能提升在STS基准上的句子嵌入质量?
- RQ2与仅使用交叉熵损失的SBERT相比,所提方法的性能如何?
- RQ3超参数λ(损失权重)、τ(温度)以及N+ / N−(正样本/负样本数量)对模型性能有何影响?
- RQ4监督对比学习是否在无监督(STS)和有监督(SentEval)迁移任务中均提供一致的性能增益?
- RQ5与标准微调基线相比,所提方法是否具有计算效率优势?
主要发现
- 与SBERT基线相比,所提方法在STS基准上的平均性能提升了2.8%。
- 在各类句子迁移任务中,该方法相比SBERT基线在平均准确率上提升了1.05%。
- 最佳模型配置在SentEval任务中使用λ = 0.1,在STS任务中使用λ = 0.3,表明最优损失权重因评估任务而异。
- 温度τ = 1.0在STS和SentEval任务上均表现最佳,表明硬负样本与软负样本之间存在最佳平衡。
- 为每个锚点使用所有可用的正样本和负样本(N+ = all, N− = all)时性能最高,当仅使用对比损失(λ = 1.0)时性能下降。
- 该方法计算高效,训练最佳模型仅需36分钟——比SBERT基线多16分钟。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。