Skip to main content
QUICK REVIEW

[论文解读] SPLADE-v3: New baselines for SPLADE

Carlos Lassance, Hervé Déjean|arXiv (Cornell University)|Mar 11, 2024
Medical Imaging Techniques and Applications被引用 4
一句话总结

SPLADE-v3 引入了一类新型稀疏检索模型,其在多种基准测试中显著优于 BM25 和 SPLADE++。通过结合多负样本训练、基于集成的蒸馏得分,以及混合 KL 散度与 MarginMSE 损失函数,SPLADE-v3 实现了最先进性能,在 MRR@10 和 nDCG@10 等关键指标上甚至超越了交叉编码器重排序模型。

ABSTRACT

A companion to the release of the latest version of the SPLADE library. We describe changes to the training structure and present our latest series of models -- SPLADE-v3. We compare this new version to BM25, SPLADE++, as well as re-rankers, and showcase its effectiveness via a meta-analysis over more than 40 query sets. SPLADE-v3 further pushes the limit of SPLADE models: it is statistically significantly more effective than both BM25 and SPLADE++, while comparing well to cross-encoder re-rankers. Specifically, it gets more than 40 MRR@10 on the MS MARCO dev set, and improves by 2% the out-of-domain results on the BEIR benchmark.

研究动机与目标

  • 建立 SPLADE 基础稀疏检索模型的新基准。
  • 通过优化训练流程而非重大架构改动,提升泛化能力与有效性。
  • 在 BEIR、MS MARCO 和 LoTTE 等多样化、域外设置下评估 SPLADE-v3 的表现。
  • 在域内与零样本检索场景下,对比 SPLADE-v3 与 BM25、SPLADE++ 及交叉编码器重排序模型的性能。
  • 发布多种变体(如 DistilBERT、Lexical、Doc),以平衡有效性与推理效率。

提出的方法

  • 每条查询使用 100 个负样本进行训练——其中 50 个来自 top-50,50 个来自 top-1k,利用 SPLADE++ 模型提升负样本挖掘效果。
  • 通过五种交叉编码器模型的集成(包括 MS-MARCO MiniLM 和 TREC DL 2022 模型)生成蒸馏得分,以提升标签质量。
  • 采用经过重校准的蒸馏过程,通过仿射变换使得分的均值与标准差与先前蒸馏分布相匹配。
  • 结合两种蒸馏损失:KL 散度(λ=1)与 MarginMSE(λ=0.05),通过交叉验证优化以平衡精确率与召回率。
  • 从 SPLADE++ SelfDistil 开始训练,而非 CoCondenser 或 DistilBERT,实证表明该方式可提升最终性能。
  • 使用 ranx 库对每条查询的蒸馏得分进行最小-最大归一化,以确保跨查询的评分一致性。

实验结果

研究问题

  • RQ1是否仅通过改进训练流程(而非架构创新)即可显著提升 SPLADE 模型的有效性?
  • RQ2使用多负样本与基于集成的蒸馏得分是否能带来可测量的检索性能提升?
  • RQ3SPLADE-v3 在广泛的域内与域外检索基准测试中,相较于 BM25 和 SPLADE++ 表现如何?
  • RQ4当作为第一阶段检索器并配合 top-50 重排序时,SPLADE-v3 是否能与交叉编码器重排序模型比肩甚至超越?
  • RQ5在 SPLADE-v3 的不同变体(如 DistilBERT、Lexical、Doc)中,有效性与推理效率之间的权衡如何?

主要发现

  • 在 MS MARCO 开发集上,SPLADE-v3 的 MRR@10 达到 40.2,显著优于 BM25 和 SPLADE++。
  • 在 BEIR 基准测试中,SPLADE-v3 在 13 个数据集上相较 SPLADE++ 实现了 ↑2% 的域外性能提升,平均 nDCG@10 达到 51.7。
  • 在 44 个查询集的元分析中,SPLADE-v3 在 41 个查询集中优于 BM25,仅有 3 个出现轻微且不显著的下降。
  • 在 44 个查询集中的 43 个,SPLADE-v3 表现优于 SPLADE++ SelfDistil,唯一例外是 Quora 数据集,性能略有下降。
  • 在对 top-50 文档进行重排序时,DeBERTaV3 在多数数据集上优于 SPLADE-v3,但 MiniLM 表现相当,表明该模型的重排序收益极小。
  • SPLADE-v3-Lexical 在 MS MARCO 和 LoTTE 上表现优异,但在 BEIR 上表现欠佳,凸显了查询编码对域外泛化的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。