Skip to main content
QUICK REVIEW

[论文解读] Predicting purchasing intent: Automatic Feature Learning using Recurrent Neural Networks

Humphrey Sheil, Omer Rana|arXiv (Cornell University)|Jul 21, 2018
Consumer Market Behavior and PricingBusiness, Management and Accounting参考文献 28被引用 18
一句话总结

本文提出一种基于长短期记忆(LSTM)网络与可学习嵌入表示的深度学习方法,用于在无需人工特征工程的情况下预测电子商务用户购买意图。该模型在首个基准数据集上达到最先进性能的98.4%,在第二个数据集上则超越了最先进水平,表明通过RNN实现的自动特征学习可与梯度提升机等传统方法相媲美甚至超越,同时降低对领域特定特征工程的依赖。

ABSTRACT

We present a neural network for predicting purchasing intent in an Ecommerce setting. Our main contribution is to address the significant investment in feature engineering that is usually associated with state-of-the-art methods such as Gradient Boosted Machines. We use trainable vector spaces to model varied, semi-structured input data comprising categoricals, quantities and unique instances. Multi-layer recurrent neural networks capture both session-local and dataset-global event dependencies and relationships for user sessions of any length. An exploration of model design decisions including parameter sharing and skip connections further increase model accuracy. Results on benchmark datasets deliver classification accuracy within 98% of state-of-the-art on one and exceed state-of-the-art on the second without the need for any domain / dataset-specific feature engineering on both short and long event sequences.

研究动机与目标

  • 减少在电子商务用户意图预测中对大量、领域特定特征工程的依赖。
  • 开发一种深度学习模型,能够从原始点击流数据中自动学习表征。
  • 评估具有可学习嵌入的RNN是否能够达到或超越最先进模型(如梯度提升机)的性能。
  • 评估模型在具有不同会话长度分布的多个电子商务数据集上的泛化能力。
  • 证明一种极简、硬件效率高的深度学习模型可实现与标准工业方法相当的性能。

提出的方法

  • 使用多层长短期记忆(LSTM)网络来建模电子商务会话中的序列用户行为。
  • 采用可训练的嵌入层,将类别型项目、数量及唯一实例在共享向量空间中进行表示。
  • 在时间步之间共享参数,以提升在短序列上的泛化能力并减少过拟合。
  • 使用跳跃连接以稳定训练过程并改善深层网络中的梯度流动。
  • 利用端到端反向传播,使梯度能够同时更新嵌入层与网络权重。
  • 在单张GPU上使用交叉熵损失函数、早停策略与Adam优化器进行模型训练。

实验结果

研究问题

  • RQ1具有可学习嵌入的循环神经网络是否能在无需人工特征工程的情况下实现用户购买意图预测的最先进性能?
  • RQ2所提出的RNN模型在基准电子商务数据集上的性能与梯度提升机相比如何?
  • RQ3如跳跃连接与参数共享等架构选择对模型准确率与训练稳定性有何影响?
  • RQ4该模型在具有不同会话长度分布的数据集(尤其是以单次点击会话为主的数据集)上的泛化能力如何?
  • RQ5该模型是否能在极低硬件需求下保持高性能,从而具备实际部署的可行性?

主要发现

  • 所提出的LSTM模型在首个基准数据集上实现了98.4%的最先进AUC性能,且无需任何特征工程。
  • 在第二个数据集上,模型性能超越最先进水平,AUC达到0.837,优于梯度提升机基线的0.834。
  • 冻结嵌入层后,模型性能下降至AUC 0.808,且训练时间增加三倍,表明端到端训练的重要性。
  • 在短会话(尤其是单次点击会话)中,该模型优于梯度提升机,后者缺乏如停留时间或序列上下文等特征。
  • 该模型在单张GPU上训练约需6小时,显存仅需1–2 GB,相比以往使用150台机器的工作,资源需求显著降低。
  • 该模型在不同数据集间具有良好的泛化能力,即使会话长度分布差异显著,仍能保持强劲性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。