[论文解读] Less is More: Pre-training a Strong Siamese Encoder Using a Weak Decoder.
本文提出 SEED-Encoder,一种通过弱解码器进行预训练的孪生编码器,该解码器仅从 [CLS] 标记重建序列,强制编码器学习鲁棒且针对匹配任务优化的表征。该方法在网页搜索和推荐基准的零样本与少样本序列匹配任务中显著提升了性能。
Many real-world applications use Siamese networks to efficiently match text sequences at scale, which require high-quality sequence encodings. This paper pre-trains language models dedicated to sequence matching in Siamese architectures. We first hypothesize that a representation is better for sequence matching if the entire sequence can be reconstructed from it, which, however, is unlikely to be achieved in standard autoencoders: A strong decoder can rely on its capacity and natural language patterns to reconstruct and bypass the needs of better sequence encodings. Therefore we propose a new self-learning method that pretrains the encoder with a weak which reconstructs the original sequence from the encoder's [CLS] representations but is restricted in both capacity and attention span. In our experiments on web search and recommendation, the pre-trained SEED-Encoder, SiamEsE oriented encoder by reconstructing from weak decoder, shows significantly better generalization ability when fine-tuned in Siamese networks, improving overall accuracy and few-shot performances. Our code and models will be released.
研究动机与目标
- 提升真实应用场景(如网页搜索和推荐)中孪生网络的序列编码质量。
- 解决标准自编码器的局限性,即强解码器可能绕过对高质量编码的需求。
- 探究是否可通过限制重建能力与注意力范围,利用弱解码器强制实现更优的序列匹配表征学习。
- 开发一种自监督预训练方法,以提升微调后孪生网络的泛化能力。
- 通过更鲁棒的编码器架构,展示在少样本与零样本设置下的性能提升。
提出的方法
- 使用基于 [CLS] 表征的自监督重建目标,预训练孪生编码器。
- 采用容量有限且注意力范围受限的弱解码器,从 [CLS] 标记重建完整输入序列。
- 限制解码器依赖语言模式或长距离依赖关系的能力,迫使编码器学习更具信息量的表征。
- 训练编码器生成的 [CLS] 表征在解码器约束下足以实现准确的序列重建。
- 将预训练编码器应用于下游孪生网络进行序列匹配,仅微调分类器头。
- 使用重建损失作为代理目标,以提升序列匹配任务中序列编码的质量。
实验结果
研究问题
- RQ1能否通过仅从 [CLS] 标记重建序列的弱解码器,提升孪生网络序列编码的质量?
- RQ2对解码器容量与注意力范围的约束是否能提升序列匹配任务中的泛化能力?
- RQ3与标准自编码或对比学习预训练相比,使用弱解码器预训练在少样本与零样本设置下的表现如何?
- RQ4所提出的方法能否在真实世界的网页搜索与推荐任务中提升性能?
- RQ5当通过弱解码器强制重建时,编码器的表征质量提升到何种程度?
主要发现
- SEED-Encoder 在零样本与少样本序列匹配场景下,均优于标准预训练基线方法。
- 在微调后,该模型在下游孪生网络中实现了显著更高的准确率,尤其在低数据场景下表现突出。
- 弱解码器的约束有效防止了解码器绕过对高质量编码器表征的需求。
- 预训练编码器在多样化的序列匹配任务(包括网页搜索与推荐)中展现出更强的泛化能力。
- 该方法表现出强大的迁移性能,表明 [CLS] 表征学习到了更鲁棒且更具判别性的特征。
- 作者确认,弱解码器的局限性是该方法成功的关键,因为更强的解码器无法强制实现更优的编码。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。