[论文解读] Improving Native Ads CTR Prediction by Large Scale Event Embedding and Recurrent Networks
本文提出了一种基于用户浏览序列弱监督的大型事件嵌入方案,结合循环神经网络与注意力机制,以提升原生广告点击率(CTR)预测性能。该方法通过有效建模用户行为序列,并从URL、标题和描述中学习语义有意义的事件表示,实现了70.8%的AUC,显著优于基线模型。
Click through rate (CTR) prediction is very important for Native advertisement but also hard as there is no direct query intent. In this paper we propose a large-scale event embedding scheme to encode the each user browsing event by training a Siamese network with weak supervision on the users' consecutive events. The CTR prediction problem is modeled as a supervised recurrent neural network, which naturally model the user history as a sequence of events. Our proposed recurrent models utilizing pretrained event embedding vectors and an attention layer to model the user history. Our experiments demonstrate that our model significantly outperforms the baseline and some variants.
研究动机与目标
- 通过将用户浏览历史建模为序列事件,解决原生广告中用户查询意图不足的挑战。
- 通过学习用户事件的密集低维表示,不依赖显式的查询信号,提升CTR预测的准确性。
- 开发一种可扩展的弱监督事件嵌入框架,从URL、标题和描述中捕捉语义与时间模式。
- 将预训练事件嵌入集成到带有注意力机制的循环模型中,以更好地捕捉长期用户偏好与序列依赖关系。
提出的方法
- 使用对比损失在连续用户浏览事件上训练孪生网络,以在潜在空间中学习事件嵌入。
- 将每个用户事件表示为URL、标题和描述的三元组,并通过孪生网络将其嵌入到固定大小的向量空间中。
- 将预训练的事件嵌入作为输入,输入到循环神经网络(LSTM或GRU)中,以建模用户活动序列。
- 在嵌入事件序列上应用注意力机制,动态加权其在CTR预测中的重要性。
- 使用Adam优化器、Dropout和梯度裁剪端到端训练模型,以防止过拟合与梯度消失。
- 使用真实世界原生广告点击预测数据集的AUC评估性能,比较使用与不使用预训练嵌入及注意力机制的模型变体。
实验结果
研究问题
- RQ1弱监督事件嵌入能否有效捕捉原生广告中用户浏览事件的语义与时间模式?
- RQ2与词袋事件或非序列模型相比,通过RNN进行序列建模在CTR预测中有多大提升?
- RQ3使用预训练事件嵌入在模型泛化能力与性能方面,相较于端到端训练嵌入,提升程度如何?
- RQ4在事件序列上应用注意力机制是否能通过聚焦相关历史事件进一步提升CTR预测性能?
- RQ5用户历史的最佳长度是多少?性能是否在某一序列长度后趋于饱和?
主要发现
- 所提出的预训练事件嵌入方案显著提升了CTR预测性能,在使用GRU与注意力机制时,测试AUC达到70.8%,优于所有基线模型。
- 在所有配置中,基于GRU的模型始终优于基于LSTM的模型,使用注意力机制时达到最高AUC 70.8%。
- 注意力机制带来可测量的性能提升,将GRU模型的AUC从69.7%提高至70.8%。
- 使用序列中最后10个事件的性能优于更短序列,但超过10个事件后性能趋于平稳,表明更长历史的收益递减。
- 预训练嵌入减少了过拟合,表现为训练与测试AUC差距更小(0.741 vs. 0.711),而端到端训练的差距更大(0.746 vs. 0.683)。
- 该模型对未见项目具有良好的泛化能力,因为预训练嵌入方案在无需丰富内容特征的情况下,从URL、标题和描述中学习到稳健的表示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。