[论文解读] Pre-trained Language Model for Web-scale Retrieval in Baidu Search
本文提出了一套面向百度搜索的生产就绪型检索系统,利用ERNIE预训练语言模型提升大规模网络检索中的语义匹配效果。通过采用基于Transformer的双编码器架构与多阶段训练范式,并结合统一的部署工作流,该系统显著提升了检索效果——尤其在低频查询与自然语言查询方面表现突出,线上用户参与度指标(如点击率与停留时间)均实现显著提升。
Retrieval is a crucial stage in web search that identifies a small set of query-relevant candidates from a billion-scale corpus. Discovering more semantically-related candidates in the retrieval stage is very promising to expose more high-quality results to the end users. However, it still remains non-trivial challenges of building and deploying effective retrieval models for semantic matching in real search engine. In this paper, we describe the retrieval system that we developed and deployed in Baidu Search. The system exploits the recent state-of-the-art Chinese pretrained language model, namely Enhanced Representation through kNowledge IntEgration (ERNIE), which facilitates the system with expressive semantic matching. In particular, we developed an ERNIE-based retrieval model, which is equipped with 1) expressive Transformer-based semantic encoders, and 2) a comprehensive multi-stage training paradigm. More importantly, we present a practical system workflow for deploying the model in web-scale retrieval. Eventually, the system is fully deployed into production, where rigorous offline and online experiments were conducted. The results show that the system can perform high-quality candidate retrieval, especially for those tail queries with uncommon demands. Overall, the new retrieval system facilitated by pretrained language model (i.e., ERNIE) can largely improve the usability and applicability of our search engine.
研究动机与目标
- 为解决大规模网络检索中的语义匹配挑战,传统基于关键词的方法(如BM25)难以捕捉改写或语义相似的内容。
- 提升低频、尾部查询的检索性能,这些查询因训练信号有限而难以建模。
- 设计一种实用且可扩展的系统架构,实现在真实高流量搜索引擎中部署预训练语言模型(ERNIE)。
- 将语义匹配与传统文本匹配及统计特征相结合,以提升候选结果的相关性与系统鲁棒性。
提出的方法
- 系统采用基于ERNIE的双编码器,为查询和文档分别使用独立编码器,利用Transformer的深层自注意力机制建模细粒度的语义表征。
- 采用多阶段训练范式,利用多样化数据源与目标,逐步提升模型泛化能力,尤其针对罕见或未登录词查询。
- 检索流水线结合语义匹配与传统BM25检索,实现混合候选生成策略,平衡召回率与精确率。
- 引入轻量级的后检索过滤模块,统一整合统计特征(如点击率、停留时间),在初始检索后对顶级候选结果进行精炼。
- 系统在生产环境中部署,具备可扩展的基础设施,支持在百亿规模网页语料上实现低延迟推理。
- 通过多交互微调方案与数据挖掘策略对模型进行微调,以增强查询-文档对之间的相关性预测能力。

实验结果
研究问题
- RQ1相较于传统基于关键词的方法,ERNIE等预训练语言模型是否能在大规模网络检索中显著提升语义匹配效果?
- RQ2多阶段训练在多大程度上提升了检索模型的泛化能力,特别是对低频或尾部查询?
- RQ3在后检索过滤阶段整合语义与统计特征,能在多大程度上提升最终结果质量?
- RQ4所提出的系统架构是否能够实现基于PLM的检索模型在真实世界搜索引擎中的有效且高效部署?
主要发现
- 在离线评估中,基于ERNIE的检索模型在随机查询上的归一化折损累计增益(DCG)提升了+0.17%,在尾部查询上提升了+0.22%。
- 后检索过滤模块在随机查询上贡献了+0.10%的DCG提升,在尾部查询上贡献了+0.65%,表明对罕见查询影响更强。
- 在人工评估中,新系统在随机查询上的Good vs. Same vs. Bad(GSB)评分相对提升了+3.50%,在尾部查询上提升了+7.50%,表明质量显著提升。
- 线上A/B测试显示,总点击量提升0.31%,点击后停留行为提升0.57%,平均点击后停留时间提升0.62%,所有结果均满足p < 0.05的显著性水平。
- 系统在长句、自然语言查询上的提升幅度大于短查询,表明对对话式与复杂查询的处理能力更强。
- ERNIE检索与后检索过滤的结合在所有指标上均带来统计显著的增益,验证了混合架构的有效性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。