[论文解读] Densifying Sparse Representations for Passage Retrieval by Representational Slicing
该论文提出了一种无需训练的方法,通过表征切片对稀疏表示进行密集化,实现与稠密嵌入的可解释、高效且有效的融合。该方法使用门控内积(GIP)计算相关性得分,在性能上与强大的稠密模型(如COIL)相当,同时减少了索引大小,并支持快速的检索-重排序推理。
Learned sparse and dense representations capture different successful approaches to text retrieval and the fusion of their results has proven to be more effective and robust. Prior work combines dense and sparse retrievers by fusing their model scores. As an alternative, this paper presents a simple approach to densifying sparse representations for text retrieval that does not involve any training. Our densified sparse representations (DSRs) are interpretable and can be easily combined with dense representations for end-to-end retrieval. We demonstrate that our approach can jointly learn sparse and dense representations within a single model and then combine them for dense retrieval. Experimental results suggest that combining our DSRs and dense representations yields a balanced tradeoff between effectiveness and efficiency.
研究动机与目标
- 开发一种无需额外训练即可对稀疏表示进行密集化的方法。
- 在统一的检索框架中实现对密集化稀疏表示与稠密表示的直接融合。
- 通过结合稀疏表示与稠密表示的互补信号,提升检索的有效性与效率。
- 在模型透明度至关重要的场景中,为稠密表示提供一种可解释的替代方案。
- 在保持高检索性能的同时,减少索引大小与查询延迟。
提出的方法
- 该方法将高维稀疏表示划分为 M 个互不重叠的 N 维切片。
- 对每个切片,提取最大激活值及其位置(索引),形成紧凑表示。
- 使用门控内积(GIP)计算查询与文档之间的相关性,仅考虑各切片中索引匹配的维度。
- 采用检索-重排序策略:首先仅使用 DSRs 检索前 10K 个候选,然后使用融合后的 DSR 与稠密得分对候选进行重排序。
- 该方法端到端应用于联合双编码器模型,同时学习稀疏表示与稠密表示。
- 切片策略包括步长切片、连续切片与随机切片;其中步长与随机切片表现最优。
实验结果
研究问题
- RQ1是否可以在不进行训练的情况下对稀疏表示进行密集化,同时保持可解释性与有效性?
- RQ2门控内积(GIP)与标准内积相比,在效率与有效性方面表现如何?
- RQ3在单一检索框架中,密集化稀疏表示(DSRs)能否与稠密表示实现有效融合?
- RQ4不同切片策略(如步长、连续、随机)对检索性能有何影响?
- RQ5检索-重排序流水线是否能在显著提升 DSR 推理速度的同时保持有效性?
主要发现
- 768维的DSR模型在MS MARCO开发集上达到MRR@10为0.343,R@1K为0.957,性能与强大的稠密模型相当。
- 采用θ = 0.1的检索-重排序流水线仅增加10ms延迟,但实现了10倍的检索加速,同时保持了有效性。
- 将128维DSRs与稠密[CLS]表示融合,其效率与有效性优于纯稠密模型或仅DSR模型。
- 采用步长切片的DSR-SPLADE模型(768维)在MS MARCO开发集上达到MRR@10为0.343,R@1K为0.957,性能与随机切片相当,但优于连续切片(MRR@10: 0.332)。
- 融合模型DSR-{SPLADE} + Dense-[CLS]的检索性能接近COIL(最有效的稠密模型),但索引大小显著减小。
- 门控内积(GIP)实现了DSRs与稠密表示的有效融合,表明即使时间复杂度较高,只要结合高效的检索流水线,也不会阻碍实际性能表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。