Skip to main content
QUICK REVIEW

[论文解读] Sparsifying Sparse Representations for Passage Retrieval by Top-$k$ Masking

Jheng-Hong Yang, Xueguang Ma|arXiv (Cornell University)|Dec 17, 2021
Topic Modeling被引用 6
一句话总结

该论文提出SPLADE-mask,一种通过应用top-$k$掩码控制稀疏性,并利用KL散度进行自学习以对齐掩码与未掩码表示的简单而有效的方法,用于学习段落检索中的稀疏词汇表示。该方法在MS MARCO开发集上实现了0.373的SOTA MRR@10,优于更复杂的模型,且无需使用困难负样本挖掘或蒸馏。

ABSTRACT

Sparse lexical representation learning has demonstrated much progress in improving passage retrieval effectiveness in recent models such as DeepImpact, uniCOIL, and SPLADE. This paper describes a straightforward yet effective approach for sparsifying lexical representations for passage retrieval, building on SPLADE by introducing a top-$k$ masking scheme to control sparsity and a self-learning method to coax masked representations to mimic unmasked representations. A basic implementation of our model is competitive with more sophisticated approaches and achieves a good balance between effectiveness and efficiency. The simplicity of our methods opens the door for future explorations in lexical representation learning for passage retrieval.

研究动机与目标

  • 在不依赖复杂训练机制的前提下,提升段落检索中稀疏词汇表示的有效性。
  • 通过top-$k$掩码机制控制词汇表示中的稀疏性。
  • 通过自监督学习对齐掩码表示与未掩码表示,以提升模型性能。
  • 在检索有效性与计算效率之间实现有利的权衡。
  • 证明简单的架构修改可在词汇表示学习中超越更复杂的模型。

提出的方法

  • 引入一种top-$k$掩码方案,仅保留表示中权重最高的$k$个标记,从而降低维度并强制实现稀疏性。
  • 在训练过程中采用指数衰减调度器调整$k$,逐步增加保留的标记数量。
  • 基于KL散度设计自学习目标,对齐掩码表示与原始未掩码表示的分布。
  • 使用标准排序损失(如基于边距或对比损失)优化查询与文档之间的相关性得分。
  • 以SPLADE框架为基础,利用掩码语言模型在词汇空间中预测词的重要性。
  • 通过结合对比损失与基于KL的自学习,端到端训练模型,以提升泛化能力。

实验结果

研究问题

  • RQ1简单的top-$k$掩码策略是否能提升段落检索中稀疏词汇表示的有效性?
  • RQ2通过掩码表示与未掩码表示之间的KL散度进行自学习,是否能增强模型性能?
  • RQ3对SPLADE进行最小程度的修改,是否能在无需困难负样本挖掘或蒸馏的情况下实现SOTA结果?
  • RQ4所提出方法在标准基准上的有效性与更复杂模型相比如何?
  • RQ5在学习到的词汇表示中,检索性能、模型大小与推理效率之间的权衡如何?

主要发现

  • SPLADE-mask在MS MARCO开发集上实现了0.373的MRR@10,优于之前的SOTA模型SPLADE-distil(0.368)。
  • top-$k$掩码与基于KL散度的自学习相结合,取得了最高有效性,相比基线模型SPLADE-max提升了0.005。
  • 该模型以相对简单的架构实现了SOTA性能,且无需困难负样本挖掘或交叉编码器蒸馏。
  • 该模型的索引大小为5.4 GiB,略大于SPLADE-distil(5.0 GiB),但仍与其他词汇模型具有竞争力。
  • 在TREC DL19和DL20上,SPLADE-mask的有效性低于顶尖模型,但原因尚不明确。
  • 结果表明,top-$k$掩码与自学习是有效且正交的改进方法,可与其他技术(如蒸馏)结合以获得进一步增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。