[论文解读] ConTextual Masked Auto-Encoder for Dense Passage Retrieval
本论文提出 CoT-MAE,一种用于密集段落检索的新型生成式预训练方法,采用具有双重掩码自编码目标的非对称编码器-解码器架构:在段落内部进行自监督掩码,以及利用邻近段落表示进行上下文监督掩码。该方法在 MS-MARCO 数据集上取得了最先进性能,显著优于 coCondenser 和 BERT 等强基线模型的检索效果。
Dense passage retrieval aims to retrieve the relevant passages of a query from a large corpus based on dense representations (i.e., vectors) of the query and the passages. Recent studies have explored improving pre-trained language models to boost dense retrieval performance. This paper proposes CoT-MAE (ConTextual Masked Auto-Encoder), a simple yet effective generative pre-training method for dense passage retrieval. CoT-MAE employs an asymmetric encoder-decoder architecture that learns to compress the sentence semantics into a dense vector through self-supervised and context-supervised masked auto-encoding. Precisely, self-supervised masked auto-encoding learns to model the semantics of the tokens inside a text span, and context-supervised masked auto-encoding learns to model the semantical correlation between the text spans. We conduct experiments on large-scale passage retrieval benchmarks and show considerable improvements over strong baselines, demonstrating the high efficiency of CoT-MAE. Our code is available at https://github.com/caskcsg/ir/tree/main/cotmae.
研究动机与目标
- 通过更有效的预训练方法增强文本表示学习,以提升密集段落检索性能。
- 通过引入段间语义相关性,解决先前方法仅关注单文本内部建模的局限性。
- 探索在密集检索中使用段落级别上下文定位进行生成式预训练的有效性。
- 设计一种灵活的非对称编码器-解码器架构,通过解码器对上下文的依赖增强编码器表示。
- 证明联合建模段内语义与段间上下文可提升检索性能。
提出的方法
- CoT-MAE 使用非对称编码器-解码器 Transformer 架构,其中编码器较深,解码器较浅。
- 对每个段落独立应用自监督掩码自编码,仅使用同一段落内的未掩码标记来重建被掩码的标记。
- 引入上下文监督掩码自编码,其中解码器利用其未掩码标记和邻近段落的编码嵌入来重建被掩码的段落。
- 通过掩码语言建模(MLM)损失联合优化两个目标,且仅在预训练阶段使用解码器。
- 通过采样策略从文档中构建段落对,形成用于训练的语义相关文本对。
- 编码器从 BERT 初始化,解码器从 BERT 层或随机初始化,同时对初始化方式的影响进行消融实验。
实验结果
研究问题
- RQ1通过生成式预训练联合建模段内语义与段间上下文,能否提升密集段落检索性能?
- RQ2与仅使用自监督掩码相比,上下文监督掩码自编码在增强文本表示方面表现如何?
- RQ3在非对称架构中,解码器的最佳深度与初始化策略为何?
- RQ4具有上下文依赖的非对称编码器-解码器设计是否能生成优于对称或标准自编码的编码器表示?
- RQ5该方法能否在不同查询类型与段落相关性模式下泛化,从而提升检索性能?
主要发现
- CoT-MAE 在 MS-MARCO 段落排序数据集上达到 MRR@10 为 38.2,显著优于 coCondenser(38.2)和 BERT base 模型。
- 当使用两层解码器时,CoT-MAE 达到最佳性能,表明解码器过浅或过深均会降低结果。
- 解码器采用随机权重初始化时,性能在训练 600k 步后仍持续提升,而其他初始化方法则更早达到平台期。
- 该模型在定性层面表现显著提升,即使基线模型仅依赖词级别重叠,也能正确检索出语义相关的段落。
- 该方法在不同初始化与架构选择下均表现出鲁棒性,且持续优于强基线模型。
- 消融实验证实,上下文监督掩码至关重要,当仅使用自监督掩码时,模型性能明显下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。