Skip to main content
QUICK REVIEW

[论文解读] Self-supervised Incremental Deep Graph Learning for Ethereum Phishing Scam Detection

Shucheng Li, Fengyuan Xu|arXiv (Cornell University)|Jun 18, 2021
Blockchain Technology Applications and Security参考文献 34被引用 10
一句话总结

本文提出 SIEGE,一种用于检测以太坊钓鱼诈骗的自监督增量深度图学习模型。通过在无标签交易数据上利用空间和时间的预训练任务,并按时间块处理数据,SIEGE 在归纳设置下实现 54.6% 的 F1 分数,在直推设置下实现 52.7%,优于强基线模型 4%–16%。

ABSTRACT

In recent years, phishing scams have become the crime type with the largest money involved on Ethereum, the second-largest blockchain platform. Meanwhile, graph neural network (GNN) has shown promising performance in various node classification tasks. However, for Ethereum transaction data, which could be naturally abstracted to a real-world complex graph, the scarcity of labels and the huge volume of transaction data make it difficult to take advantage of GNN methods. Here in this paper, to address the two challenges, we propose a Self-supervised Incremental deep Graph learning model (SIEGE), for the phishing scam detection problem on Ethereum. In our model, two pretext tasks designed from spatial and temporal perspectives help us effectively learn useful node embedding from the huge amount of unlabelled transaction data. And the incremental paradigm allows us to efficiently handle large-scale transaction data and help the model maintain good performance when the data distribution is drastically changing. We collect transaction records about half a year from Ethereum and our extensive experiments show that our model consistently outperforms strong baselines in both transductive and inductive settings.

研究动机与目标

  • 解决以太坊钓鱼诈骗检测中的标签稀缺问题,即用于训练的正样本极少。
  • 克服由于以太坊交易图规模巨大且持续增长(半年内超过 7000 万笔交易)带来的数据可扩展性问题。
  • 开发一种归纳学习方法,使其能泛化到新的、未见过的图部分,这对在动态区块链中实现实时异常检测至关重要。
  • 设计一种可扩展的、增量式训练范式,即使在数据分布随时间发生剧烈变化的情况下也能保持模型性能。
  • 整合自监督预训练任务,以捕捉空间(节点邻域)和时间(交易序列)动态,从而在无标签情况下提升节点表征学习能力。

提出的方法

  • 将以太坊交易图划分为时间块(例如,交易块),并按时间顺序逐块处理,以实现可扩展、内存高效的训练。
  • 采用自监督学习框架,包含两个预训练任务:空间任务通过对比学习预测节点邻域,时间任务通过重建交易序列。
  • 利用图神经网络(GNN)和可学习编码器生成节点嵌入,其中 GNN 通过两个预训练任务联合优化。
  • 将前一个块的中间模型参数和节点表征传递到下一个块,实现增量适应,并在动态图中保持一致性。
  • 应用对比学习目标,对齐正样本节点对(空间邻居)并推开负样本对,从而提升表征质量。
  • 使用 Adam 优化器,通过学习率(0.01、0.001、0.0001)、dropout(0.5)和隐藏层大小(32–256)的超参数搜索,采用批量大小 512 进行小批量训练。

实验结果

研究问题

  • RQ1在无标签情况下,利用空间和时间图动态的自监督预训练任务是否能改善节点表征学习,从而提升钓鱼诈骗检测性能?
  • RQ2在处理大规模、动态演变的以太坊交易图且数据分布发生漂移时,增量学习策略在保持模型性能方面的有效性如何?
  • RQ3所提出的 SIEGE 模型在归纳设置下的泛化能力如何,即模型能否在完全新的、未见过的图区域中检测诈骗?
  • RQ4各个组件(空间与时间预训练任务)对整体检测性能的贡献程度如何?
  • RQ5即使使用相同的自监督目标,与非增量训练相比,增量训练机制是否能提升检测性能?

主要发现

  • 在直推设置下,SIEGE 实现 54.6% 的 F1 分数,优于最佳基线模型(DGI)4.3 个百分点。
  • 在归纳设置下,SIEGE 达到 52.7% 的 F1 分数,超过次佳基线模型(DGI)4.1 个百分点。
  • 消融实验表明,移除空间预训练任务会使 F1 降至 40.9%,而移除时间任务则降至 44.1%,表明两者均至关重要,但空间学习的影响更大。
  • 与非增量版本相比,增量学习组件使性能提升 1.9 个 F1 分数点(52.7 vs. 50.8),证明其在应对分布漂移方面的价值。
  • 即使未经微调,未训练的 GCN 和 DGI 模型表现也具有竞争力,但 SIEGE 在所有设置下均持续超越它们。
  • 该模型在直推和归纳设置下均保持强劲性能,证实其在动态区块链图上的归纳泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。