Skip to main content
QUICK REVIEW

[论文解读] SimLM: Pre-training with Representation Bottleneck for Dense Passage Retrieval

Liang Wang, Nan Yang|arXiv (Cornell University)|Jul 6, 2022
Topic Modeling被引用 6
一句话总结

SimLM 提出了一种简单但高效的密集段落检索预训练方法,采用表示瓶颈架构并结合替换语言建模。通过强制 [CLS] 标记压缩关键段落语义以实现重建,该方法在 MS-MARCO 和 NQ 数据集上实现了最先进性能,优于甚至超过像 ColBERTv2 这类多向量模型,且存储成本更低。

ABSTRACT

In this paper, we propose SimLM (Similarity matching with Language Model pre-training), a simple yet effective pre-training method for dense passage retrieval. It employs a simple bottleneck architecture that learns to compress the passage information into a dense vector through self-supervised pre-training. We use a replaced language modeling objective, which is inspired by ELECTRA, to improve the sample efficiency and reduce the mismatch of the input distribution between pre-training and fine-tuning. SimLM only requires access to unlabeled corpus, and is more broadly applicable when there are no labeled data or queries. We conduct experiments on several large-scale passage retrieval datasets, and show substantial improvements over strong baselines under various settings. Remarkably, SimLM even outperforms multi-vector approaches such as ColBERTv2 which incurs significantly more storage cost. Our code and model check points are available at https://github.com/microsoft/unilm/tree/master/simlm .

研究动机与目标

  • 为解决 NLU 预训练基准与密集检索性能之间的一致性问题,即 RoBERTa 和 ELECTRA 等模型在检索任务上泛化能力较差。
  • 通过将掩码语言建模替换为替换语言建模目标,提升样本效率并减少预训练与微调之间输入分布的不匹配。
  • 训练一个鲁棒的双编码器检索器,通过压缩的 [CLS] 表示瓶颈捕捉语义和词汇信息。
  • 在无需标注查询或合成数据的情况下实现有效预训练,仅使用无标注语料。
  • 实现与昂贵的多向量模型(如 ColBERTv2)相当或更优的检索性能,同时降低存储成本。

提出的方法

  • SimLM 使用编码器-解码器架构,在 [CLS] 标记处引入表示瓶颈,其中编码器将段落信息压缩为稠密向量。
  • 其采用受 ELECTRA 启发的替换语言建模目标:将掩码标记替换为生成器采样的标记,解码器则从瓶颈表示中预测原始标记。
  • 解码器容量有限,迫使它依赖瓶颈表示进行准确重建,从而促使编码器学习到丰富且压缩的表示。
  • 预训练目标对所有输入标记计算损失,而不仅限于掩码标记,从而提升样本效率并减少微调时的分布偏移。
  • 该方法无需对比学习或合成查询,仅依赖纯文本进行预训练。
  • 最终模型在标注检索数据上使用标准双编码器训练(含负样本采样)进行微调。

实验结果

研究问题

  • RQ1仅使用无标注数据,是否可通过简单的表示瓶颈与替换语言建模预训练显著提升密集段落检索性能?
  • RQ2将掩码语言建模替换为替换语言建模目标,是否能减少输入分布不匹配并提升样本效率?
  • RQ3单个 [CLS] 向量瓶颈是否能有效捕捉所有关键段落语义,从而优于多向量方法?
  • RQ4在目标语料上预训练与在非目标或通用语料上预训练相比,对下游检索性能有何影响?
  • RQ5SimLM 是否能在存储成本低于 ColBERTv2 的前提下实现最先进性能?

主要发现

  • 在 MS-MARCO 语料上预训练时,SimLM 在 MS-MARCO 开发集上达到 MRR@10 为 38.0,显著优于 BERT-base 的 33.7。
  • 在 Natural Questions 数据集上,SimLM 在使用挖掘的困难负样本时达到 R@1k 为 98.3,优于基线 BERT-base 模型。
  • SimLM 收敛速度快于标准掩码语言建模,在仅 10k 训练步数内即达到竞争性性能,而 MLM 在超过 60k 步后仍缓慢提升。
  • 在目标语料上预训练带来最大收益,但即使在非目标语料(如 Wikipedia 或 MS-MARCO)上预训练,性能仍优于 BERT-base 基线。
  • SimLM 在检索性能上优于 ColBERTv2,同时显著降低存储需求,证明了其高效性与有效性。
  • 定性分析表明,SimLM 能检索到语义对齐更好的段落,并准确捕捉关键意图(如金融查询中的路由号码),而 BERT-base 则失败。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。