Skip to main content
QUICK REVIEW

[论文解读] Neural Feature Embedding for User Response Prediction in Real-Time Bidding (RTB)

Enno Shioji, Masayuki Arai|arXiv (Cornell University)|Feb 2, 2017
Recommender Systems and Techniques参考文献 18被引用 4
一句话总结

本文提出一种神经特征嵌入方法,通过使用类似CBOW的模型学习用户网络浏览历史内容ID的稠密向量表示,以提升实时竞价(RTB)中的用户响应预测性能。该方法通过缓解特征稀疏性问题,显著提升了预测准确率,尤其在数据稀缺情况下表现突出,其中SB+DR(稀疏二值 + 分布式表示)相比基线逻辑回归模型在小规模训练集上实现了最高4.9%的AUC提升。

ABSTRACT

In the area of ad-targeting, predicting user responses is essential for many applications such as Real-Time Bidding (RTB). Many of the features available in this domain are sparse categorical features. This presents a challenge especially when the user responses to be predicted are rare, because each feature will only have very few positive examples. Recently, neural embedding techniques such as word2vec which learn distributed representations of words using occurrence statistics in the corpus have been shown to be effective in many Natural Language Processing tasks. In this paper, we use real-world data set to show that a similar technique can be used to learn distributed representations of features from users' web history, and that such representations can be used to improve the accuracy of commonly used models for predicting rare user responses.

研究动机与目标

  • 解决实时竞价(RTB)中特征稀疏性的问题,特别是针对转化等罕见用户响应的预测挑战。
  • 克服逻辑回归模型中对稀疏类别特征使用独热编码时因泛化能力差而导致的局限性。
  • 探究在自然语言处理中已被证明有效的神经嵌入技术是否可被适配,以学习用户网络浏览历史特征的分布式表示,从而提升预测性能。
  • 评估学习到的嵌入在与传统模型结合使用时的性能表现,特别是在低数据场景下的表现。
  • 证明在工业级RTB系统中,对特征嵌入进行无监督预训练的可行性和有效性。

提出的方法

  • 将自然语言处理中的连续袋-模型(CBOW)适配用于从用户网络浏览序列中学习内容ID的稠密向量表示。
  • 采用负采样方法,通过最大化观察到的共现对的似然性并最小化随机负对的似然性,实现高效训练。
  • 在400万条最旧的广告曝光实例上训练嵌入模型,剔除点击标签以确保无监督学习。
  • 在预测阶段,将学习到的嵌入作为输入特征:可单独使用(DR),或与独热编码特征拼接后输入逻辑回归模型(SB+DR)。
  • 通过将每个嵌入维度按其最大绝对值进行缩放,以稳定训练过程并提升泛化能力。
  • 应用数据下采样(采样率0.01)以处理点击预测任务中的类别不平衡问题,在总计500万条实例中保留110万条正样本。

实验结果

研究问题

  • RQ1能否将神经词嵌入技术有效迁移至以用户网络浏览序列为序列数据的RTB用户响应预测任务中?
  • RQ2与传统独热编码相比,学习到的内容ID分布式表示在标签数据有限时能否显著提升预测准确率?
  • RQ3在不同数据规模下,组合特征表示(稀疏二值 + 分布式表示)相较于单一组件的表现如何?
  • RQ4RTB用户响应预测中,最优的嵌入维度是多少?性能是否在某一尺寸后趋于饱和?
  • RQ5在无需端到端重新训练的前提下,是否可将特征嵌入的无监督预训练方法实际部署于工业级RTB流水线中?

主要发现

  • 在小规模训练集上,DR(分布式表示)模型优于SB(稀疏二值)基线,在0.3K训练样本时实现4.90%的AUC提升。
  • SB+DR模型在所有数据规模下均优于SB和DR单独使用,且在0.3K训练样本时达到最大相对提升(4.33% AUC提升)。
  • 随着训练数据量增加,嵌入带来的性能增益逐渐减弱;在10万样本时,DR单独使用反而落后于SB,表明在数据充足时高维表示可能限制判别能力。
  • AUC性能随嵌入维度增加至16维时持续提升,之后趋于平稳,表明在此之后收益递减。
  • 该方法通过利用大规模用户浏览历史中的共现统计信息,实现了对罕见特征的有效泛化,即使在标注响应数据稀缺时亦然。
  • 该方法与标准工业模型(如逻辑回归)兼容,可在无需架构重构的前提下轻松部署于实时竞价系统中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。