Skip to main content
QUICK REVIEW

[论文解读] Dichotomic Pattern Mining with Applications to Intent Prediction from Semi-Structured Clickstream Datasets

Xin Wang, Serdar Kadıoğlu|arXiv (Cornell University)|Jan 23, 2022
Data Mining Algorithms and Applications被引用 6
一句话总结

本文提出了一种基于约束的二分模式挖掘方法,用于从半结构化的点击流数据中提取可解释的、频繁的序列模式,以实现意图预测。通过将序列划分为正样本和负样本结果组,并挖掘具有唯一性且经约束过滤的模式,该方法生成高性能、人类可读的特征嵌入,从而提升下游机器学习模型的性能,同时保持可解释性,在无需人工特征工程的情况下实现了最先进水平的F1分数。

ABSTRACT

We introduce a pattern mining framework that operates on semi-structured datasets and exploits the dichotomy between outcomes. Our approach takes advantage of constraint reasoning to find sequential patterns that occur frequently and exhibit desired properties. This allows the creation of novel pattern embeddings that are useful for knowledge extraction and predictive modeling. Finally, we present an application on customer intent prediction from digital clickstream data. Overall, we show that pattern embeddings play an integrator role between semi-structured data and machine learning models, improve the performance of the downstream task and retain interpretability.

研究动机与目标

  • 解决从半结构化的点击流数据中提取有意义且可解释的模式以支持下游预测任务的挑战。
  • 通过用基于序列行为的模式嵌入替代手工设计的特征,实现意图预测中的自动化特征工程。
  • 通过约束推理与模式挖掘,在保持可解释性的同时提升客户意图预测的模型性能。
  • 证明模式嵌入能够有效连接序列数据与机器学习模型。

提出的方法

  • 该方法根据二元标签(例如,购买 vs. 未购买)将序列数据库进行二分划分,分为正样本组和负样本组。
  • 在正样本组和负样本组上分别独立应用基于约束的序列模式挖掘(CSPM),以在用户定义的约束条件下(例如,停留时间、价格区间)发现频繁模式。
  • 识别每组中的独特模式(Pos_unique、Neg_unique)以及共有的模式(PN_union),以突出区分性的行为特征。
  • 将所得的模式集合用作下游机器学习模型(如LightGBM、浅层神经网络和LSTM)的特征嵌入。
  • 该方法使用Seq2Pat实现模式的自动化生成,并利用SHAP值解释特征重要性,提取高层次洞察。
  • 通过应用约束来过滤无关或噪声模式,减少搜索空间,提高所发现模式的相关性。

实验结果

研究问题

  • RQ1基于约束的序列模式挖掘能否有效从半结构化的点击流数据中提取出可解释且高影响力的用户行为模式?
  • RQ2通过二分挖掘生成的模式嵌入在意图预测性能上与手工特征相比如何?
  • RQ3基于模式的特征在多种机器学习模型(包括LightGBM、浅层神经网络和LSTM)上的性能提升程度如何?
  • RQ4所生成的模式嵌入是否能在实现自动化、可扩展的特征生成的同时保持可解释性?
  • RQ5从数据集中最具预测力的模式中,可以提取出哪些高层次的行为信号?

主要发现

  • 由Seq2Pat生成的模式嵌入在F1分数上与参考研究中使用手工特征的结果相当,证明了特征工程自动化的有效性。
  • 使用Seq2Pat特征微调后的LSTM模型(LSTM_Seq2Pat)取得了最高的F1分数和AUC,表明基于模式的特征增强带来了显著的性能提升。
  • 最具预测力的模式⟨3,1,1⟩对应于将商品加入购物车,证实其与购买意图存在强相关性。
  • 重复的页面浏览(⟨1,1,1,1,1,1,1⟩)和特定商品的浏览(⟨2,1,1,1⟩)与购买意图呈正相关,而广泛的探索行为(⟨1,1,2,1,2⟩)则呈负相关。
  • 模式⟨4,1,1⟩(先移除商品再浏览多个页面)是强有力的正向预测因子,表明存在未被利用的精准促销机会。
  • 搜索操作(⟨6⟩)对预测结果影响极小,提示搜索系统质量和相关性可能存在潜在问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。