Skip to main content
QUICK REVIEW

[论文解读] Ethereum Fraud Detection with Heterogeneous Graph Neural Networks

Hiroki Kanezashi, Toyotaro Suzumura|arXiv (Cornell University)|Mar 23, 2022
Blockchain Technology Applications and Security被引用 10
一句话总结

本文提出了一种异质图神经网络(GNN)方法,用于检测以太坊交易网络中的钓鱼欺诈行为,通过利用节点类型和边类型异质性来提升检测性能。RGCN 模型在精确率、召回率、F1 分数和 PR-AUC 上均优于所有同质化及异质化 GNN 域基准模型,证明了显式建模边类型可显著提升真实区块链数据上的欺诈检测准确率。

ABSTRACT

While transactions with cryptocurrencies such as Ethereum are becoming more prevalent, fraud and other criminal transactions are not uncommon. Graph analysis algorithms and machine learning techniques detect suspicious transactions that lead to phishing in large transaction networks. Many graph neural network (GNN) models have been proposed to apply deep learning techniques to graph structures. Although there is research on phishing detection using GNN models in the Ethereum transaction network, models that address the scale of the number of vertices and edges and the imbalance of labels have not yet been studied. In this paper, we compared the model performance of GNN models on the actual Ethereum transaction network dataset and phishing reported label data to exhaustively compare and verify which GNN models and hyperparameters produce the best accuracy. Specifically, we evaluated the model performance of representative homogeneous GNN models which consider single-type nodes and edges and heterogeneous GNN models which support different types of nodes and edges. We showed that heterogeneous models had better model performance than homogeneous models. In particular, the RGCN model achieved the best performance in the overall metrics.

研究动机与目标

  • 为解决在大规模、类别不平衡的以太坊交易网络中,使用图神经网络检测钓鱼欺诈的挑战。
  • 评估并比较同质化与异质化 GNN 模型在带有已标注钓鱼报告的真实以太坊交易数据上的性能表现。
  • 探究显式建模节点类型与边类型是否能提升欺诈检测准确率,相较于同质化 GNN 模型。
  • 识别在异质区块链图中实现高效欺诈检测的最优超参数与模型配置。
  • 为异质化 GNN,特别是 RGCN,在处理现实世界加密货币欺诈检测中常见的规模与标签不平衡问题方面,提供实证证据。

提出的方法

  • 从真实以太坊日志构建异质交易网络,将节点分类为钱包、交易所等类型。
  • 在交易图上应用具有代表性的同质化 GNN(GCN、GraphSAGE、GAT)与异质化 GNN(RGCN、HAN、HGT)。
  • 将边类型(基于节点类型对)作为异质化模型的关键输入,实现类型特定的消息传递。
  • 使用来自已报告欺诈事件的钓鱼标签进行监督学习训练,以精确率、召回率、F1 分数和 PR-AUC 为优化目标。
  • 执行全面的超参数调优,包括隐藏层大小、初始学习率、dropout 比例与权重衰减。
  • 在存在显著类别不平衡的真实数据集上,使用标准指标评估模型性能。

实验结果

研究问题

  • RQ1与同质化 GNN 相比,显式建模以太坊交易网络中的节点与边类型异质性是否能提升欺诈检测性能?
  • RQ2在真实以太坊钓鱼欺诈数据上,同质化或异质化 GNN 架构中,哪种模型在精确率、召回率与 F1 分数上表现最佳?
  • RQ3学习率、隐藏层大小、dropout 比例与权重衰减等超参数在此上下文中如何影响模型性能?
  • RQ4仅对节点类型进行独热编码是否足以使同质化 GNN 的性能达到异质化模型的水平?
  • RQ5RGCN 中基于边类型的特定学习在多大程度上促成了其卓越的检测准确率?

主要发现

  • RGCN 模型在所有指标上均取得最佳综合性能,优于所有同质化与其他异质化 GNN 模型,涵盖精确率、召回率、F1 分数与 PR-AUC。
  • 异质化 GNN 模型,特别是 RGCN,显著优于 GCN、GAT 与 GraphSAGE 等同质化 GNN 模型,证实了建模边类型的优势。
  • 在同质化模型中,GraphSAGE 达到最高精确率,但其召回率与 F1 分数低于 RGCN。
  • HAN 与 HGT 等异质化模型表现出较强的召回率与 F1 分数,但仍逊于 RGCN,表明 RGCN 具备更优越的边类型感知学习能力。
  • 对节点类型进行独热编码并未使同质化 GNN 的性能达到 RGCN 水平,表明显式建模边类型至关重要。
  • 发现较小的学习率、较大的隐藏层大小,以及避免使用 dropout 与权重衰减,有助于提升模型性能,这与典型深度学习实践相反。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。