Skip to main content
QUICK REVIEW

[论文解读] Heterogeneous Graph Neural Networks for Malicious Account Detection

Ziqi Liu, Chaochao Chen|arXiv (Cornell University)|Feb 27, 2020
Network Security and Intrusion Detection参考文献 22被引用 6
一句话总结

本文提出GEM,一种异构图神经网络,通过建模蚂蚁借呗账户-设备图中的设备与行为聚合模式来检测恶意账户。通过使用注意力机制为不同设备类型赋予权重,并利用图卷积层学习判别性嵌入,GEM在在线部署中实现了98%的精确率,且在精确率-召回率权衡上优于基线模型,尤其在高召回场景下表现更优。

ABSTRACT

We present, GEM, the first heterogeneous graph neural network approach for detecting malicious accounts at Alipay, one of the world's leading mobile cashless payment platform. Our approach, inspired from a connected subgraph approach, adaptively learns discriminative embeddings from heterogeneous account-device graphs based on two fundamental weaknesses of attackers, i.e. device aggregation and activity aggregation. For the heterogeneous graph consists of various types of nodes, we propose an attention mechanism to learn the importance of different types of nodes, while using the sum operator for modeling the aggregation patterns of nodes in each type. Experiments show that our approaches consistently perform promising results compared with competitive methods over time.

研究动机与目标

  • 解决在蚂蚁借呗等大规模金融平台中检测恶意账户的挑战,攻击者利用设备与行为聚合进行攻击。
  • 克服基于规则和传统图方法因信噪比低而导致的高假阴性率问题。
  • 开发一种基于神经网络的方法,联合建模设备聚合与行为聚合作为攻击者的核心弱点。
  • 通过学习异构设备类型(如UMID、手机号、MAC)的自适应、数据驱动重要性,提升检测性能。
  • 实现实时、可扩展的恶意账户检测,实现高精确率与高召回率,减少误报同时捕获更多高风险账户。

提出的方法

  • 构建一个异构账户-设备图,其中节点代表账户及各类设备类型(如UMID、手机号、MAC、IMSI),边表示账户与设备的关联关系。
  • 应用使用求和聚合算子的图卷积网络(GCNs),对同类型节点的特征进行聚合,以捕捉图中的结构模式。
  • 引入注意力机制,学习每类设备类型的动态、数据驱动的重要性系数,使模型能降低对噪声或不可靠设备(如IP地址)的权重。
  • 采用两层GCN架构,实现多跳信息传播,使模型即使在未直接连接的情况下也能检测到恶意簇。
  • 使用历史标注数据进行端到端的监督学习训练,以F1分数为优化目标,并应用L2正则化防止过拟合。
  • 通过精确率-召回率曲线、嵌入维度与深度的消融实验,以及注意力系数分析,评估模型性能并解释特征重要性。

实验结果

研究问题

  • RQ1异构图神经网络能否通过将设备聚合与行为聚合建模为攻击者弱点,有效检测恶意账户?
  • RQ2注意力机制如何通过学习不同设备类型在识别恶意行为中的相对重要性来提升检测性能?
  • RQ3在真实蚂蚁借呗数据上,图神经网络方法在精确率与召回率方面相较于传统连通子图与基于规则的方法,优势有多大?
  • RQ4在该异构图设置下,GCN架构的最优深度与嵌入维度是多少?它们如何影响模型泛化能力?
  • RQ5该模型能否在实时系统中实现高精确率与高覆盖率?与现有基于规则的系统相比,实际表现如何?

主要发现

  • 采用注意力机制的GEM-attention在精确率-召回率曲线下方面积上显著优于所有基线模型。
  • 在在线部署中,对每日新注册的前10,000个账户进行评估时,模型精确率超过98%,展现出强大的实际可靠性。
  • 与先前基于规则的系统相比,GEM检测到的恶意账户多出10%,同时保持高精确率,表明召回率提升而未牺牲准确性。
  • 注意力系数显示,UMID(0.4412)和手机号(0.2952)是最具信息量的设备类型,而IMSI与TID(0.0142与0.0125)贡献甚微,验证了模型的可解释性。
  • 至少两层隐藏层对性能至关重要,单层模型因异构图结构导致无法捕获足够的邻域信息而表现不佳。
  • 当应用适当的正则化时,嵌入维度从8到128的变化对F1分数无显著影响,表明模型对超参数选择具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。