Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised Incremental Deep Graph Learning for Ethereum Phishing Scam Detection

Shucheng Li, Fengyuan Xu|arXiv (Cornell University)|Jun 18, 2021
Blockchain Technology Applications and Security参考文献 34被引用数 10
ひとこと要約

本稿では、Ethereumのフィッシングス캠を検出する自己教師付き段階的ディープグラフ学習モデルSIEGEを提案する。ラベルなし取引データを用いて空間的および時間的プリテキストタスクを活用し、時系列ブロックに分割して処理することで、推論設定で54.6%、インダクティブ設定で52.7%のF1スコアを達成し、強力なベースラインを4%〜16%上回る性能を発揮した。

ABSTRACT

In recent years, phishing scams have become the crime type with the largest money involved on Ethereum, the second-largest blockchain platform. Meanwhile, graph neural network (GNN) has shown promising performance in various node classification tasks. However, for Ethereum transaction data, which could be naturally abstracted to a real-world complex graph, the scarcity of labels and the huge volume of transaction data make it difficult to take advantage of GNN methods. Here in this paper, to address the two challenges, we propose a Self-supervised Incremental deep Graph learning model (SIEGE), for the phishing scam detection problem on Ethereum. In our model, two pretext tasks designed from spatial and temporal perspectives help us effectively learn useful node embedding from the huge amount of unlabelled transaction data. And the incremental paradigm allows us to efficiently handle large-scale transaction data and help the model maintain good performance when the data distribution is drastically changing. We collect transaction records about half a year from Ethereum and our extensive experiments show that our model consistently outperforms strong baselines in both transductive and inductive settings.

研究の動機と目的

  • トレーニングに利用可能な陽性サンプルが非常に少ないEthereumフィッシングスキャン検出の課題に対処する。
  • 6か月間で7000万件を超える取引を含む、巨大で継続的に成長を続けるEthereum取引グラフのためのデータスケーラビリティ問題を克服する。
  • 新しい未観測のグラフ領域にも一般化可能なインダクティブ学習手法を開発する。これは、変化し続けるブロックチェーンにおけるリアルタイム異常検出にとって不可欠である。
  • データ分布の急激な変化にもかかわらず、モデル性能を維持できるスケーラブルで段階的な学習パラダイムを設計する。
  • ラベルなしで、空間的(ノードの近隣)および時間的(取引の順序)なダイナミクスを捉える自己教師付きプリテキストタスクを統合し、ノード表現学習の質を向上させる。

提案手法

  • Ethereum取引グラフを時系列ブロック(例:取引ブロック)に分割し、順序に従って段階的に処理することで、スケーラブルでメモリ効率の良いトレーニングを実現する。
  • 2つのプリテキストタスクを用いた自己教師付き学習フレームワークを採用する。空間的タスクはコントラスト学習によりノードの近隣を予測し、時間的タスクは取引の順序を再構築する。
  • グラフニューラルネットワーク(GNN)を用い、学習可能なエンコーダーでノード埋め込みを生成する。GNNは2つのプリテキストタスクを同時に最適化することで学習される。
  • 1つのブロックから次のブロックへと中間のモデルパラメータおよびノード表現を伝達することで、段階的適応を実現し、変化するグラフ全体に一貫性を保つ。
  • コントラスト学習の目的関数を用い、正例ペア(空間的近隣ノード)を一致させ、負例ペアを分離することで、表現の質を向上させる。
  • ハイパーパramータ探索を実施し、Adam最適化手法を用いる。学習率(0.01、0.001、0.0001)、ドロップアウト率(0.5)、隠れ層次元(32〜256)を調整し、ミニバッチ学習ではバッチサイズ512を採用する。

実験結果

リサーチクエスチョン

  • RQ1ラベルなし環境下で、空間的および時間的グラフダイナミクスを活用する自己教師付きプリテキストタスクは、フィッシングスキャン検出のためのノード表現学習を改善できるか?
  • RQ2データ分布の変化が著しい大規模かつ変化し続けるEthereum取引グラフを処理する際、段階的学習戦略はモデル性能を維持できるか?
  • RQ3提案されたSIEGEモデルは、完全に新しい未観測のグラフ領域でのスキャン検出にどの程度一般化できるか?
  • RQ4個々の構成要素(空間的対比 vs. 時間的再構築)は、全体の検出性能にどの程度寄与しているか?
  • RQ5同じ自己教師付き目的関数を用いても、段階的トレーニング機構は非段階的トレーニングに比べて検出性能を向上させられるか?

主な発見

  • SIEGEは推論設定で54.6%のF1スコアを達成し、最良のベースライン(DGI)を4.3ポイント上回った。
  • インダクティブ設定では52.7%のF1スコアを達成し、次に優れたベースライン(DGI)を4.1ポイント上回った。
  • アブレーションスタディの結果、空間的プリテキストタスクを削除するとF1スコアは40.9%に低下し、時間的タスクを削除すると44.1%に低下した。両者とも不可欠であるが、空間的学習の方がより大きな影響を持つことが示された。
  • 段階的学習コンponentにより、非段階的バージョン(52.7 vs. 50.8)と比較してF1スコアが1.9ポイント向上し、分布シフトへの対応における価値が裏付けられた。
  • 微調整を行わずとも、未学習のGCNおよびDGIモデルは競争力のある性能を示すが、SIEGEはあらゆる設定で一貫してそれらを上回った。
  • SIEGEは推論設定およびインダクティブ設定の両方で優れた性能を維持しており、変化するブロックチェーングラフにおけるインダクティブ一般化能力が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。