[논문 리뷰] Self-supervised Incremental Deep Graph Learning for Ethereum Phishing Scam Detection
이 논문은 이더리움 피싱 스캠을 탐지하기 위한 자기지도 학습적 점진적 딥 그래프 학습 모델인 SIEGE를 제안한다. 레이블이 없는 거래 데이터에 공간적 및 시간적 사전 과제를 활용하고, 시간 순서대로 데이터를 블록 단위로 처리함으로써 SIEGE는 유전적 설정에서 54.6%의 F1 스코어를 기록하고, 인덕티브 설정에서는 52.7%를 기록하여 강력한 베이스라인들보다 4%~16% 높은 성능을 달성한다.
In recent years, phishing scams have become the crime type with the largest money involved on Ethereum, the second-largest blockchain platform. Meanwhile, graph neural network (GNN) has shown promising performance in various node classification tasks. However, for Ethereum transaction data, which could be naturally abstracted to a real-world complex graph, the scarcity of labels and the huge volume of transaction data make it difficult to take advantage of GNN methods. Here in this paper, to address the two challenges, we propose a Self-supervised Incremental deep Graph learning model (SIEGE), for the phishing scam detection problem on Ethereum. In our model, two pretext tasks designed from spatial and temporal perspectives help us effectively learn useful node embedding from the huge amount of unlabelled transaction data. And the incremental paradigm allows us to efficiently handle large-scale transaction data and help the model maintain good performance when the data distribution is drastically changing. We collect transaction records about half a year from Ethereum and our extensive experiments show that our model consistently outperforms strong baselines in both transductive and inductive settings.
연구 동기 및 목표
- 레이블 부족 문제를 해결한다. 이더리움 피싱 스캠 탐지에서 훈련에 사용 가능한 양성 샘플이 매우 적기 때문이다.
- 이더리움 거래 그래프의 기하급수적인 크기와 지속적인 성장으로 인한 데이터 스케일링 문제를 해결한다. 반기 만에 7000만 건이 넘는 거래가 발생한다.
- 새로운, 볼 수 없는 그래프 부분에 일반화할 수 있는 인덕티브 학습 방법을 개발한다. 이는 변화하는 블록체인에서 실시간 이상 탐지에 필수적이다.
- 모델 성능이 시간에 따라 급격히 변화하는 데이터 분포 변화에도 불구하고 유지되는 확장 가능한 점진적 훈련 프레임워크를 설계한다.
- 레이블 없이도 공간적(노드 이웃 관계) 및 시간적(거래 순서) 동적 특성을 캡처하는 자기지도 학습 사전 과제를 통합하여 노드 표현 학습을 향상시킨다.
제안 방법
- 이더리움 거래 그래프를 시간 순서 블록(예: 거래 블록)으로 분할하고, 이를 순차적으로 처리하여 확장성 있고 메모리 효율적인 훈련을 가능하게 한다.
- 두 가지 사전 과제를 가진 자기지도 학습 프레임워크를 사용한다: 공간 과제는 대조 학습을 통해 노드 이웃을 예측하고, 시간 과제는 거래 순서를 재구성한다.
- 그래프 신경망(GNN)을 사용하여 노드 임베딩을 생성하며, GNN은 두 사전 과제를 함께 최적화한다.
- 한 블록에서 다음 블록으로 중간 모델 파라미터와 노드 표현을 전달하여 점진적 적응과 변화하는 그래프 간의 일관성을 유지한다.
- 양성 노드 쌍(공간적 이웃)을 정렬하고 부정 쌍을 분리하는 대조 학습 목적함수를 적용하여 표현 품질을 향상시킨다.
- 학습률(0.01, 0.001, 0.0001), 드롭아웃(0.5), 히든 사이즈(32–256)에 대한 초모수 탐색을 수행하고, 미니배치 훈련을 위해 배치 크기를 512로 설정한 Adam 옵timizer를 사용한다.
실험 결과
연구 질문
- RQ1레이블이 없을 경우 공간적 및 시간적 그래프 동적 특성을 동시에 활용하는 자기지도 사전 과제가 피싱 스캠 탐지에 대한 노드 표현 학습을 얼마나 향상시킬 수 있는가?
- RQ2데이터 분포가 변화하는 대규모이고 변화하는 이더리움 거래 그래프를 처리할 때 점진적 학습 전략이 모델 성능을 유지하는 데 얼마나 효과적인가?
- RQ3제안된 SIEGE 모델이 새로운, 전혀 볼 수 없는 그래프 영역에서 스캠을 탐지할 수 있도록 얼마나 잘 일반화되는가?
- RQ4개별 구성 요소인 공간적 사전 과제와 시간적 사전 과제가 전체 탐지 성능에 각각 어떤 기여를 하는가?
- RQ5동일한 자기지도 목적함수를 사용하더라도 점진적 훈련 메커니즘이 비점진적 훈련보다 탐지 성능을 향상시킬 수 있는가?
주요 결과
- SIEGE는 유전적 설정에서 54.6%의 F1 스코어를 기록하며, 최고의 베이스라인(DGI)보다 4.3个百分点 높다.
- 인덕티브 설정에서는 SIEGE가 52.7%의 F1 스코어를 기록하며, 다음으로 좋은 베이스라인(DGI)을 4.1个百分点 초월한다.
- 아블레이션 연구 결과, 공간 사전 과제를 제거하면 F1 스코어가 40.9%로 떨어지고, 시간 과제를 제거하면 44.1%로 떨어지며, 이는 두 과제 모두 필수적이지만 공간 학습이 더 큰 영향을 미친다는 것을 시사한다.
- 점진적 학습 구성 요소는 비점진적 버전(52.7 vs. 50.8)과 비교해 F1 스코어를 1.9 포인트 향상시켜, 분포 변화를 다룰 때의 가치를 입증한다.
- 피팅 튜닝 없이도 미학습된 GCN 및 DGI 모델이 경쟁적인 성능을 보이지만, SIEGE는 모든 설정에서 일관되게 이를 뛰어넘는다.
- SIEGE는 유전적 및 인덕티브 설정 모두에서 뛰어난 성능을 유지하며, 변화하는 블록체인 그래프에서의 인덕티브 일반화 능력을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.