Skip to main content
QUICK REVIEW

[论文解读] Spectrum-based deep neural networks for fraud detection

Shuhan Yuan, Xintao Wu|arXiv (Cornell University)|Jun 3, 2017
Imbalanced Data Classification Techniques参考文献 11被引用 8
一句话总结

本文提出了一种基于谱的深度学习框架,用于在签名图中进行欺诈检测,利用邻接矩阵特征向量导出的谱坐标。通过将节点投影到低维谱空间,并将其坐标与1跳邻居的坐标相结合,该方法在标注数据有限的情况下实现了有效的欺诈检测,优于基于邻接矩阵的方法,在使用20%训练数据时,卷积神经网络(CNN)的准确率最高达到82.61%。

ABSTRACT

In this paper, we focus on fraud detection on a signed graph with only a small set of labeled training data. We propose a novel framework that combines deep neural networks and spectral graph analysis. In particular, we use the node projection (called as spectral coordinate) in the low dimensional spectral space of the graph's adjacency matrix as input of deep neural networks. Spectral coordinates in the spectral space capture the most useful topology information of the network. Due to the small dimension of spectral coordinates (compared with the dimension of the adjacency matrix derived from a graph), training deep neural networks becomes feasible. We develop and evaluate two neural networks, deep autoencoder and convolutional neural network, in our fraud detection framework. Experimental results on a real signed graph show that our spectrum based deep neural networks are effective in fraud detection.

研究动机与目标

  • 解决在标注训练数据有限的情况下,签名图中欺诈检测的挑战。
  • 通过利用谱图分析,克服深度神经网络中高维输入的问题。
  • 开发一种框架,捕捉拓扑结构,而无需依赖手工设计的图度量。
  • 通过整合正负边信息,实现在签名网络中的有效欺诈检测。
  • 评估深度自编码器(DAE)和卷积神经网络(CNN)在谱坐标上用于欺诈检测的性能。

提出的方法

  • 对签名图的邻接矩阵进行谱分解,提取前k个主特征向量,构建低维谱空间。
  • 将每个节点的谱坐标计算为其在由前k个主特征向量张成的k维子空间上的投影。
  • 将每个节点的谱坐标与其1跳邻居的谱坐标(按边符号分离为正/负)取平均后进行组合。
  • 将组合后的谱输入送入深度自编码器(DAE)和卷积神经网络(CNN)模型,实现端到端的欺诈分类。
  • 在DAE中应用预训练,以提升小规模训练集上的性能,利用学习到的隐藏表示。
  • 使用GPU加速训练,比较谱坐标输入与邻接矩阵输入在效率上的差异。

实验结果

研究问题

  • RQ1从图的邻接矩阵导出的谱坐标是否能有效表示签名图中欺诈检测的拓扑结构?
  • RQ2将节点谱坐标与邻居谱坐标结合是否能提升欺诈检测性能?
  • RQ3当使用谱坐标作为输入时,深度神经网络(DAE和CNN)相较于使用完整邻接矩阵作为输入,表现如何?
  • RQ4谱坐标维度(k)的变化对检测准确率和模型稳定性有何影响?
  • RQ5训练数据集大小如何影响DAE和CNN在谱空间中的相对性能?

主要发现

  • 将谱坐标作为深度神经网络的输入,其欺诈检测性能显著优于使用完整邻接矩阵,尤其在5%和10%的训练数据比例下表现更优。
  • 在20%的训练数据下,使用谱坐标的CNN模型准确率达到82.61%,优于相同输入下的k-NN、SVM和DAE。
  • 在低训练数据比例(如5%)下,DAE的性能优于CNN,因其预训练阶段增强了在有限标注样本下的泛化能力。
  • 当训练数据超过5%时,CNN在谱空间中优于DAE,表明CNN在数据充足时具有更强的表征能力。
  • 在所有模型中,引入1跳邻居的谱坐标使检测准确率提升1%-2%,证明了局部拓扑上下文的价值。
  • 在谱坐标上训练比在邻接矩阵上更高效,每轮训练的推理时间低于1秒,而邻接矩阵输入需约2秒。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。