[论文解读] B-PROP: Bootstrapped Pre-training with Representative Words Prediction for Ad-hoc Retrieval
B-PROP 提出了一种用于即席检索的自举式预训练方法,该方法用基于 BERT 的对比项选择替代了 PROP 中的 unigram 语言模型,以改进代表性词的采样。通过利用 BERT 的自注意力机制,基于与随机分布的偏离程度来度量词项的信息量,B-PROP 在多个即席检索基准上实现了最先进性能,即使在零样本设置下也优于 PROP 和 BM25。
Pre-training and fine-tuning have achieved remarkable success in many downstream natural language processing (NLP) tasks. Recently, pre-training methods tailored for information retrieval (IR) have also been explored, and the latest success is the PROP method which has reached new SOTA on a variety of ad-hoc retrieval benchmarks. The basic idea of PROP is to construct the extit{representative words prediction} (ROP) task for pre-training inspired by the query likelihood model. Despite its exciting performance, the effectiveness of PROP might be bounded by the classical unigram language model adopted in the ROP task construction process. To tackle this problem, we propose a bootstrapped pre-training method (namely B-PROP) based on BERT for ad-hoc retrieval. The key idea is to use the powerful contextual language model BERT to replace the classical unigram language model for the ROP task construction, and re-train BERT itself towards the tailored objective for IR. Specifically, we introduce a novel contrastive method, inspired by the divergence-from-randomness idea, to leverage BERT's self-attention mechanism to sample representative words from the document. By further fine-tuning on downstream ad-hoc retrieval tasks, our method achieves significant improvements over baselines without pre-training or with other pre-training methods, and further pushes forward the SOTA on a variety of ad-hoc retrieval tasks.
研究动机与目标
- 为解决 PROP 的局限性,即其依赖经典 unigram 语言模型进行代表性词采样,导致语义表征不理想。
- 通过用更强大的上下文语言模型(BERT)替代 unigram 模型,提升预训练中代表性词选择的质量。
- 开发一种对比方法,通过将文档词项分布与随机分布进行比较来度量词项的信息量,从而增强采样中的语义相关性。
- 使用基于 BERT 的采样方法,对 BERT 进行微调预训练目标(ROP),以提升下游即席检索任务的性能。
- 在标准即席检索基准上,评估 B-PROP 在零样本和微调设置下的有效性。
提出的方法
- 将 PROP 中的经典 unigram 语言模型替换为 BERT,以生成更具语义信息的词项分布,用于代表性词采样。
- 引入一种受与随机分布偏离原理启发的对比方法,用以度量词项偏离随机分布的程度,从而指示其代表性。
- 利用 BERT 的自注意力机制计算跨标记的注意力得分,进而用于识别并从文档中采样信息量丰富的词项。
- 使用基于 BERT 的采样词对构建代表性词预测(ROP)任务,使模型学习判断哪组词更具有代表性。
- 在下游即席检索任务上,使用标准监督数据对 BERT 模型进行微调,以利用改进的预训练目标。
- 在预训练过程中将 ROP 目标与掩码语言模型(MLM)联合优化,以同时学习上下文表示和词项代表性。
实验结果
研究问题
- RQ1在 ROP 任务构建中,用 BERT 替代 unigram 语言模型是否能提升即席检索中代表性词采样的质量?
- RQ2基于与随机分布偏离的对比方法,是否比传统语言模型更有效地识别出语义上具有代表性的词?
- RQ3B-PROP 是否能在标准即席检索基准上实现优于 PROP 和其他基线模型的性能?
- RQ4B-PROP 在无需微调的零样本设置下,其泛化能力有多强?
- RQ5所提出的预训练目标是否能通过微调有效迁移到下游检索任务?
主要发现
- B-PROP 在 TREC Robust04、ClueWeb09-B 和 Gov2 基准上实现了新的最先进性能,优于 PROP 和其他强基线模型。
- 在 MS MARCO 文档排序排行榜上,B-PROP 显著优于之前的最先进模型,证明了其在大规模检索任务中的有效性。
- 在零样本设置下,B-PROP 在 ClueWeb09-B 和 Gov2 上优于 BM25,表明其在无微调条件下具有强大的泛化能力。
- 消融实验证实,基于 BERT 自注意力机制的对比采样方法,相比随机采样或基于 unigram 的采样,显著提升了性能。
- 在监督数据集上微调 B-PROP,可在所有评估基准上持续获得显著且一致的性能提升。
- ROP 与 MLM 预训练目标在 B-PROP 中的结合,相比单独使用任一目标,能生成更优的上下文表示和代表性词表示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。