Skip to main content
QUICK REVIEW

[论文解读] Deeply Supervised Semantic Model for Click-Through Rate Prediction in Sponsored Search

Jelena Gligorijević, Djordje Gligorijevic|arXiv (Cornell University)|Mar 28, 2018
Web Data Mining and Analysis参考文献 33被引用 3
一句话总结

该论文提出了一种深度监督语义模型(DSM),通过双损失优化联合学习查询和广告嵌入以及点击率(CTR)预测。通过引入一种新颖的队列负采样技术,并在十亿个查询-广告对上进行端到端训练,DSM在CTR预测上比最先进基线模型AUC提升2%,在查询-广告匹配任务上NDCG提升0.5%,展示了无需特征工程即可实现更优的泛化能力和语义相关性学习能力。

ABSTRACT

In sponsored search it is critical to match ads that are relevant to a query and to accurately predict their likelihood of being clicked. Commercial search engines typically use machine learning models for both query-ad relevance matching and click-through-rate (CTR) prediction. However, matching models are based on the similarity between a query and an ad, ignoring the fact that a retrieved ad may not attract clicks, while click models rely on click history, being of limited use for new queries and ads. We propose a deeply supervised architecture that jointly learns the semantic embeddings of a query and an ad as well as their corresponding CTR.We also propose a novel cohort negative sampling technique for learning implicit negative signals. We trained the proposed architecture using one billion query-ad pairs from a major commercial web search engine. This architecture improves the best-performing baseline deep neural architectures by 2\% of AUC for CTR prediction and by statistically significant 0.5\% of NDCG for query-ad matching.

研究动机与目标

  • 解决现有CTR预测模型过度依赖点击历史、难以泛化到新查询和广告的问题。
  • 通过联合学习分布式嵌入与CTR预测,提升查询与广告之间的语义相关性。
  • 克服端到端模型未显式优化语义相似性或点击行为的缺陷。
  • 开发一种方法,利用点击数据中的隐式负信号增强模型泛化能力与性能。
  • 证明通过深度监督联合训练CTR预测与查询-广告匹配,可获得更鲁棒、更准确的模型。

提出的方法

  • 使用双向RNN和注意力机制,从原始文本中学习查询和广告的上下文分布式嵌入。
  • 使用卷积神经网络(CNN)融合查询和广告嵌入,并通过带有逻辑激活函数的最终层预测CTR。
  • 在多任务学习框架中优化两个独立的逻辑损失:一个用于CTR预测,另一个用于查询与广告嵌入之间的语义匹配。
  • 提出一种新颖的队列负采样策略,从点击数据中识别隐式负样本对,提升表征学习能力,无需显式标注。
  • 通过从CTR预测头和语义匹配头向所有低层反向传播梯度,实现深度监督。
  • 在商业网络搜索引擎的十亿个查询-广告对上端到端训练整个架构,实现对稀有及新查询的稳健泛化。

实验结果

研究问题

  • RQ1与仅基于点击数据训练的模型相比,联合学习CTR预测与语义嵌入是否能提升模型性能?
  • RQ2在同时优化CTR与语义匹配的双损失架构下,AUC与NDCG指标受到何种影响?
  • RQ3在缺乏显式负标签的情况下,队列负采样在多大程度上提升了模型泛化能力与表征质量?
  • RQ4即使不是主要目标,所学习的查询与广告嵌入是否能有效支持查询-广告匹配任务?
  • RQ5在不同数据条件下,该模型是否在CTR预测与语义匹配方面均优于最先进深度学习与传统模型?

主要发现

  • DSM模型在CTR预测任务上使最佳基线模型的AUC提升2%,Wilcoxon符号秩检验的p值为8.63e-5,具有统计显著性。
  • 在查询-广告匹配任务上,DSM模型在NDCG@7上相比最佳基线实现0.5%的统计显著提升,p值为2.69e-5。
  • 消融实验表明,若移除语义匹配损失,AUC将降至0.7671,验证了其对CTR预测质量的贡献。
  • DSM模型在所有评估指标(包括Precision@K与NDCG@K)上均优于传统模型(如GBDT、BM25)与深度学习基线。
  • 模型在不同数据规模、查询频率、广告位置及嵌入选择下均保持一致性能,表明其具有强大鲁棒性。
  • 理论分析证实了所提出的队列负采样技术的收敛性,可有效捕捉点击数据中的隐式负信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。