[论文解读] DiffCSE: Difference-based Contrastive Learning for Sentence Embeddings
DiffCSE 提出了一种无监督对比学习框架,用于句子嵌入,通过显式建模原始句子与掩码语言模型增强句子之间的差异,提升了语义相似度性能。通过结合基于 dropout 的增强与基于 MLM 的词替换,并训练一个差异预测头,DiffCSE 在语义文本相似度任务上取得了 SOTA 结果,相比 SimCSE 提升了 2.3 个百分点。
We propose DiffCSE, an unsupervised contrastive learning framework for learning sentence embeddings. DiffCSE learns sentence embeddings that are sensitive to the difference between the original sentence and an edited sentence, where the edited sentence is obtained by stochastically masking out the original sentence and then sampling from a masked language model. We show that DiffSCE is an instance of equivariant contrastive learning (Dangovski et al., 2021), which generalizes contrastive learning and learns representations that are insensitive to certain types of augmentations and sensitive to other "harmful" types of augmentations. Our experiments show that DiffCSE achieves state-of-the-art results among unsupervised sentence representation learning methods, outperforming unsupervised SimCSE by 2.3 absolute points on semantic textual similarity tasks.
研究动机与目标
- 开发一种对有意义语言变化敏感的对比学习框架,而非对这些变化保持不变。
- 解决标准对比学习在 NLP 中的局限性,即输入级增强(如词替换)会改变语义,因此不应被忽略。
- 通过区分对无关变换(dropout)和对敏感变换(MLM 基础)的处理,实现 NLP 中的等变对比学习。
- 在无需标注数据的情况下,提升零样本迁移和语义相似度任务中的句子表示质量。
- 证明建模原始句子与编辑后句子之间的差异,可带来对齐更优、信息量更丰富的句子嵌入。
提出的方法
- DiffCSE 使用双增强策略:一个分支对原始句子应用 dropout(无关变换),另一个分支使用掩码语言模型(敏感变换)生成编辑后的句子。
- 模型通过原始句子与 dropout 增强后句子表示之间的对比损失学习句子嵌入,以鼓励对 dropout 的不变性。
- 引入额外的交叉熵损失,用于预测原始句子与 MLM 增强句子之间的差异,使表示对有意义的变化保持敏感。
- 差异预测头与句子编码器端到端联合训练,推理时仅使用句子编码器,丢弃判别头。
- 该框架基于等变对比学习,通过学习对某些增强不变、对其他增强敏感的表示,推广了标准对比学习。
- 预训练模型和代码已发布于 https://github.com/voidism/DiffCSE。
实验结果
研究问题
- RQ1在无监督设置下,建模原始句子与 MLM 增强句子之间的差异,是否能提升句子表示学习?
- RQ2使句子嵌入对有意义的语言变化(如通过掩码语言模型进行的词替换)保持敏感,是否能提升在语义相似度任务上的性能?
- RQ3在对齐性、均匀性和下游迁移性能方面,DiffCSE 与 SimCSE 及其他对比学习基线相比表现如何?
- RQ4差异预测头在多大程度上提升了所学句子嵌入空间的质量?
- RQ5等变对比学习能否有效适配自然语言处理任务,其中输入级增强通常会改变语义含义?
主要发现
- 在语义文本相似度(STS)基准上,DiffCSE 相较于无监督的 SimCSE 提升了 2.3 个百分点,创下无监督句子表示学习的新 SOTA。
- 在 STS-B 测试集上,DiffCSE 的 recall@10 达到 97.42,高于 SimCSE 的 95.88,表明检索性能更优。
- DiffCSE 的余弦相似度分布与人类评分更一致,对人类评分相同的句子对分配了更高的相似度。
- DiffCSE 的对齐性(0.097)优于 SimCSE(0.177),同时保持相近的均匀性(-1.438 vs. -2.313),表明通过更好的对齐性提升了表示质量。
- 消融实验表明,对比损失和差异预测头均对性能有显著贡献,其中后者对语义变化的敏感性尤为关键。
- 定性分析显示,DiffCSE 学习到了更具区分性且语义更明确的句子表示,尤其在处理同义句和细微语义差异方面表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。