[论文解读] Product-based Neural Networks for User Response Prediction over Multi-field Categorical Data
本文提出了基于产品的神经网络(PNNs)以及一种新型的PIN(Product-network In Network)架构,以提升在多字段类别数据上的用户行为预测性能。通过引入核乘积层来建模字段感知的特征交互,并解决深度网络中的梯度不敏感问题,PNNs在4个工业数据集上均超越8个基线模型,在AUC和对数损失指标上达到最先进性能,并在在线A/B测试中实现34.67%的相对点击率(CTR)提升。
User response prediction is a crucial component for personalized information retrieval and filtering scenarios, such as recommender system and web search. The data in user response prediction is mostly in a multi-field categorical format and transformed into sparse representations via one-hot encoding. Due to the sparsity problems in representation and optimization, most research focuses on feature engineering and shallow modeling. Recently, deep neural networks have attracted research attention on such a problem for their high capacity and end-to-end training scheme. In this paper, we study user response prediction in the scenario of click prediction. We first analyze a coupled gradient issue in latent vector-based models and propose kernel product to learn field-aware feature interactions. Then we discuss an insensitive gradient issue in DNN-based models and propose Product-based Neural Network (PNN) which adopts a feature extractor to explore feature interactions. Generalizing the kernel product to a net-in-net architecture, we further propose Product-network In Network (PIN) which can generalize previous models. Extensive experiments on 4 industrial datasets and 1 contest dataset demonstrate that our models consistently outperform 8 baselines on both AUC and log loss. Besides, PIN makes great CTR improvement (relatively 34.67%) in online A/B test.
研究动机与目标
- 为解决基于潜在向量的模型(如FFM)中存在的耦合梯度问题,该问题限制了有效字段感知特征交互学习。
- 克服标准DNN在训练稀疏的一次独热编码多字段类别数据时的梯度不敏感问题。
- 设计一种显式建模高阶特征交互的深度学习架构,同时保持高效性和可扩展性。
- 开发一种可泛化的框架,统一并改进现有模型(如FM、FFM和标准DNN)在点击率预测中的表现。
- 在真实工业数据集上验证所提出模型,并在离线指标与在线A/B测试中均展示优越性能。
提出的方法
- 提出一种核乘积层,通过在字段特定嵌入之间的成对交互上应用可学习核函数,计算字段感知的特征交互。
- 引入基于产品的神经网络(PNN)架构,结合特征提取器与乘积层,在传递至深度分类器前建模特征交互。
- 开发产品网络内嵌网络(PIN)作为PNN的泛化形式,允许将乘积层替换为子网络,以实现更灵活的交互建模。
- 采用理论分析表明,标准DNN在学习多项式函数(poly-2)时存在梯度不敏感问题,而这类函数在用户行为预测中十分常见。
- 通过在poly-2函数上的合成实验验证,尽管具备通用近似能力,标准DNN仍无法收敛至最优解,凸显显式交互建模的必要性。
- 使用随机梯度下降进行端到端训练,以AUC和对数损失作为合成数据集与真实数据集的评估指标。
实验结果
研究问题
- RQ1与存在耦合梯度问题的传统潜在向量模型(如FFM)相比,能否更有效地学习字段感知的特征交互?
- RQ2在稀疏的多字段类别数据上,与标准DNN相比,深度网络中引入显式乘积层是否能提升性能?
- RQ3像PIN这样的通用架构能否统一并超越现有模型(如FM、FFM和标准DNN)在用户行为预测中的表现?
- RQ4DNN中的梯度不敏感问题在稀疏数据设置下,对学习简单且结构化的函数(如poly-2)有多大程度的阻碍?
- RQ5所提出的模型是否在真实工业应用中实现了可测量的离线指标与在线A/B测试性能提升?
主要发现
- PNNs在4个工业数据集上均持续优于8个基线模型,在AUC和对数损失指标上表现更优,展现出更强的泛化能力与预测准确性。
- PIN架构在在线A/B测试中实现了相对34.67%的点击率(CTR)提升,验证了其在真实场景中的有效性。
- 合成实验表明,即使增加深度与宽度,标准DNN仍无法收敛至poly-2函数的最优解,表明其存在固有的梯度不敏感问题。
- 核乘积层能有效捕捉字段感知的特征交互,并缓解FFM等模型中存在的耦合梯度问题。
- 所提出模型在不同数据稀疏程度下均表现出稳健性能,相较于标准DNN,训练稳定性与收敛性均有显著提升。
- PIN的泛化能力通过其统一并改进现有模型的能力得到验证,表明其为信息检索系统中未来深度学习研究提供了有前景的方向。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。