[论文解读] A Simple yet Effective Framework for Active Learning to Rank
本文提出了一种简单而有效的主动学习框架,用于网络搜索中的学习排序(LTR),结合排名熵(RE)以识别不确定的低频查询,以及预测方差(PV)以优先处理高多样性、高频查询。混合的RE+PV策略在相同标注预算下,将LTR模型性能提升最高达1.38%(DCG),在百度搜索引擎中降低了标注成本,同时提升了大规模训练效率。
While China has become the biggest online market in the world with around 1 billion internet users, Baidu runs the world largest Chinese search engine serving more than hundreds of millions of daily active users and responding billions queries per day. To handle the diverse query requests from users at web-scale, Baidu has done tremendous efforts in understanding users' queries, retrieve relevant contents from a pool of trillions of webpages, and rank the most relevant webpages on the top of results. Among these components used in Baidu search, learning to rank (LTR) plays a critical role and we need to timely label an extremely large number of queries together with relevant webpages to train and update the online LTR models. To reduce the costs and time consumption of queries/webpages labeling, we study the problem of Activ Learning to Rank (active LTR) that selects unlabeled queries for annotation and training in this work. Specifically, we first investigate the criterion -- Ranking Entropy (RE) characterizing the entropy of relevant webpages under a query produced by a sequence of online LTR models updated by different checkpoints, using a Query-By-Committee (QBC) method. Then, we explore a new criterion namely Prediction Variances (PV) that measures the variance of prediction results for all relevant webpages under a query. Our empirical studies find that RE may favor low-frequency queries from the pool for labeling while PV prioritizing high-frequency queries more. Finally, we combine these two complementary criteria as the sample selection strategies for active learning. Extensive experiments with comparisons to baseline algorithms show that the proposed approach could train LTR models achieving higher Discounted Cumulative Gain (i.e., the relative improvement ΔDCG4=1.38%) with the same budgeted labeling efforts.
研究动机与目标
- 通过选择最具信息量的样本进行主动学习,减少大规模网络搜索中海量查询-网页对标注的高成本与长时间开销。
- 解决在百度搜索环境中,基于不确定性的主动学习因训练信号不足而对低频查询产生偏差的问题。
- 通过结合互补标准识别能提供最大信息增益的查询,提升LTR模型训练效率。
- 开发一种可扩展、轻量级的选择策略,适用于每日数亿查询的实时部署。
- 在标注预算约束下,验证结合不确定性(RE)与多样性(PV)标准在提升排序性能方面的有效性。
提出的方法
- 该框架使用排名熵(RE)通过在多个模型检查点上应用查询委员会(QBC)方法,衡量LTR预测中的不确定性,识别出排名输出不一致的查询。
- 引入预测方差(PV)作为新标准,量化单个查询下相关网页预测排序分数的多样性,作为真实排序多样性的代理指标。
- 将RE与PV结合成混合选择策略,以平衡对不确定的低频查询的探索与对信息丰富的高频查询的利用。
- 选择RE+PV综合得分高的查询进行标注,确保同时优先考虑模型不确定性和排序多样性。
- 该方法已部署于百度生产搜索系统中,支持每日模型更新,并通过0.6%流量的在线A/B测试评估实际性能表现。
- 离线实验使用真实标注计算DCG与R01的改进,而在线实验则通过真实流量指标对比RE+PV与随机选择的表现。
实验结果
研究问题
- RQ1在真实网络搜索环境中,排名熵(RE)在识别主动学习中具有信息量的查询方面表现如何?其是否引入了特定偏差?
- RQ2预测方差(PV)能否有效捕捉真实排序标签的多样性,并作为信息增益的可靠代理用于查询选择?
- RQ3与单独使用任一标准或随机选择相比,结合RE与PV在多大程度上提升了LTR模型性能?
- RQ4该混合RE+PV策略是否在保持或提升排序质量的同时,降低了大规模网络搜索系统中的标注成本?
- RQ5所提出方法在低频查询上的表现如何?这些查询通常代表性不足,且因缺乏监督信号而难以训练。
主要发现
- 单独使用排名熵(RE)会导致对低频查询的偏向,因为训练信号不足,即使这些查询的信息增益有限,其不确定性得分仍较高。
- 预测方差(PV)与网页间真实排序分数的多样性高度相关,可作为信息增益的有效代理,倾向于选择高频且高多样性的查询。
- 在相同标注预算下,离线实验显示RE+PV组合策略在DCG@4上相对提升最高达1.38%,在线实验相比随机选择提升0.35%。
- 所提方法发现的合法训练样本对数比随机选择多出43%,显著提升了训练效率与模型泛化能力。
- 在线结果表明性能持续提升:DCG@4在所有查询上最高提升0.35%,在低频查询上最高提升0.85%;R01在低频查询上最高下降2.6%,表明顶部结果的相关性更好。
- 该框架具备可扩展性与实际部署可行性,支持每日模型更新,且在数亿查询的候选池中计算开销极低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。