Skip to main content
QUICK REVIEW

[论文解读] Sequential Behavioral Data Processing Using Deep Learning and the Markov Transition Field in Online Fraud Detection

Ruinan Zhang, Fanglan Zheng|arXiv (Cornell University)|Aug 16, 2018
Time Series Analysis and Forecasting参考文献 1被引用 19
一句话总结

本文提出一种混合深度学习模型,结合长短期记忆(LSTM)网络与卷积神经网络(CNN),在马尔可夫转移场(MTF)上进行训练,以利用序列行为数据提升在线欺诈检测性能。该方法将用户交互序列编码为MTF矩阵,以捕捉状态之间的转移概率,随后通过CNN学习空间模式,同时LSTM保留时间顺序;集成模型相比多层感知机(MLP)将欺诈预测AUC提升23%,相比单一RNN模型提升7%。

ABSTRACT

Due to the popularity of the Internet and smart mobile devices, more and more financial transactions and activities have been digitalized. Compared to traditional financial fraud detection strategies using credit-related features, customers are generating a large amount of unstructured behavioral data every second. In this paper, we propose an Recurrent Neural Netword (RNN) based deep-learning structure integrated with Markov Transition Field (MTF) for predicting online fraud behaviors using customer's interactions with websites or smart-phone apps as a series of states. In practice, we tested and proved that the proposed network structure for processing sequential behavioral data could significantly boost fraud predictive ability comparing with the multilayer perceptron network and distance based classifier with Dynamic Time Warping(DTW) as distance metric.

研究动机与目标

  • 解决利用来自网络和移动平台的高维、非结构化序列行为数据检测在线欺诈的挑战。
  • 通过深度学习实现序列模式识别,克服传统模型(如逻辑回归和基于DTW的k-NN)的局限性。
  • 设计一种新颖架构,同时保留用户交互序列中的状态间转移概率与时间顺序。
  • 评估将MTF编码与CNN及RNN组件结合以提升欺诈预测准确性的有效性。
  • 在真实世界金融交易数据上,相比基线模型展示出更优的性能表现。

提出的方法

  • 使用独热编码(one-hot encoding)对每个特征将用户交互序列编码为二值向量,以在多种数据类型间保留领域特定信息。
  • 构建大小为l×l的马尔可夫转移场(MTF)矩阵,其中每个元素表示序列中一个状态到另一个状态的转移概率。
  • 将MTF矩阵输入二维卷积神经网络(CNN),并采用平均池化(average pooling)以保留概率性转移信息,避免因最大池化(max-pooling)导致的信息损失。
  • 基于LSTM的RNN处理编码后的原始状态序列,以建模时间依赖性和序列顺序。
  • 最终分类器结合来自CNN(处理MTF)和RNN(处理原始序列)的特征,实现联合欺诈预测。
  • 模型在批量用户会话序列上进行端到端训练,性能通过柯尔莫哥洛夫-斯米尔诺夫(KS)统计量和AUC进行评估。

实验结果

研究问题

  • RQ1结合MTF编码与CNN及RNN组件的深度学习模型,是否能在从序列行为数据中检测在线欺诈方面优于传统分类器?
  • RQ2马尔可夫转移场在保留高维、多变量行为序列中的有意义转移模式方面有多有效?
  • RQ3与独立模型相比,将RNN与基于MTF的CNN结合,能在多大程度上提升欺诈检测性能?
  • RQ4该提出的架构在处理实时金融平台产生的高维、流式行为数据时,是否仍保持预测能力?
  • RQ5与基线模型(如多层感知机和基于DTW的k-NN)相比,欺诈检测性能的定量提升幅度是多少?

主要发现

  • 所提出的混合模型相比多层感知机基线模型,将欺诈预测AUC提升了23%。
  • 与单一RNN模型相比,该模型在AUC上实现了7%的提升,证明了MTF-CNN与RNN组件结合的优越性。
  • 柯尔莫哥洛夫-斯米尔诺夫(KS)统计量从基线模型的0.17提升至本模型的0.21,表明其具有强大的区分能力。
  • MTF-CNN组件有效捕捉了用户操作之间的全局转移模式,而RNN则保留了局部序列依赖性。
  • 在将每会话超过100万个特征展平的真实世界数据集上,该模型表现出鲁棒性与可扩展性。
  • CNN层中使用平均池化有效保留了关键的概率转移信息,在此情境下优于最大池化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。