Skip to main content
QUICK REVIEW

[論文レビュー] An Evaluation of Bitcoin Address Classification based on Transaction History Summarization

Yujing Lin, Po-Wei Wu|arXiv (Cornell University)|Mar 19, 2019
Blockchain Technology Applications and Security参考文献 25被引用数 8
ひとこと要約

本稿では、取引時刻(ブロック高さ)の高次モーメントに加え、基本統計および追加統計を用いて、Bitcoinアドレス分類のための新規取引履歴要約手法を提案する。これにより、異常アドレスの検出が向上する。8種類の分類器を用いた評価において、LightGBMを用いることで、最先端のマイクロ-F1スコア87%およびマクロ-F1スコア86%を達成し、時間的モーメントがベースライン特徴量に比べて分類性能を顕著に向上させることを示している。

ABSTRACT

Bitcoin is a cryptocurrency that features a distributed, decentralized and trustworthy mechanism, which has made Bitcoin a popular global transaction platform. The transaction efficiency among nations and the privacy benefiting from address anonymity of the Bitcoin network have attracted many activities such as payments, investments, gambling, and even money laundering in the past decade. Unfortunately, some criminal behaviors which took advantage of this platform were not identified. This has discouraged many governments to support cryptocurrency. Thus, the capability to identify criminal addresses becomes an important issue in the cryptocurrency network. In this paper, we propose new features in addition to those commonly used in the literature to build a classification model for detecting abnormality of Bitcoin network addresses. These features include various high orders of moments of transaction time (represented by block height) which summarizes the transaction history in an efficient way. The extracted features are trained by supervised machine learning methods on a labeling category data set. The experimental evaluation shows that these features have improved the performance of Bitcoin address classification significantly. We evaluate the results under eight classifiers and achieve the highest Micro-F1/Macro-F1 of 87%/86% with LightGBM.

研究の動機と目的

  • 標準的な統計的特徴量を超えた取引履歴要約の向上を通じて、異常Bitcoinアドレスの検出を改善すること。
  • 取引時刻(ブロック高さ)の高次モーメントが、アドレスを正常または懸念すべきものとして分類する上での影響を調査すること。
  • 基本統計、追加統計、および取引モーメントの組み合わせ特徴量が、教師あり分類モデルに与える効果を評価すること。
  • 擬似匿名なBitcoinネットワークにおけるマネーロンダリングや詐欺などの違法活動を同定する課題に対処すること。

提案手法

  • 本手法は、アドレスごとの取引履歴を、3種類の特徴量(基本統計(例:入力/出力の頻度)、追加統計(例:受信/支出されたBTC総額、残高指標)、取引モーメント(例:時間間隔および取引フローの1次および2次モーメント))を用いて要約する。
  • 取引モーメントは、ブロック高さおよび取引間隔の分布から導出され、取引活動のバースト性や規則性といった時間的パターンを捉える。
  • 各アドレスの関連する取引履歴から特徴量を抽出し、関係のないネットワーク全体のデータを除外することで、効率性とスケーラビリティを向上させる。
  • 10分割交差検証を用いた教師あり機械学習パイプラインを、8種類の分類器に対して適用し、最適モデルとしてLightGBMを選定した。
  • モデルは、Mixer、Exchange、Walletなどのタイプに分類されたラベル付きBitcoinアドレスデータセットを用いて学習させ、既知のエンティティ行動に基づくラベルを付与した。
  • LightGBMからの情報ゲインを用いて特徴量重要度を分析し、分類に最も寄与する特徴量を特定した。

実験結果

リサーチクエスチョン

  • RQ1取引時刻(ブロック高さ)の高次モーメントは、標準的な統計的特徴量に比べて、アドレスを正常または異常として分類する性能を向上させることができるか?
  • RQ2基本統計、追加統計、および取引モーメントの組み合わせが、アドレス分類モデルの性能に与える影響は何か?
  • RQ3特に提案されたモーメント特徴量を含め、どの具体的な特徴量が分類精度に最も顕著に寄与しているか?
  • RQ4提案された特徴量は、Mixer や Exchange のような高リスクエンティティの検出をどの程度向上させるか?

主な発見

  • 提案手法は、LightGBMを用いることで、マイクロ-F1スコア87%およびマクロ-F1スコア86%を達成し、従来手法に比べ顕著な向上を示した。
  • 基本統計、追加統計、およびモーメント特徴量の3種類すべての組み合わせが、いかなる単一の特徴量タイプよりも優れた分類性能を生み出した。
  • LightGBMが特定した上位10個の重要特徴量のうち、6つが提案されたモーメント特徴量に属しており、モデル性能への強力な寄与が示された。
  • 混同行列から、全カテゴリで高い正確性が確認され、Mixerは96%、Exchangeは84%の正確性を示した。これにより、多様なアドレスタイプにわたる分類の堅牢性が裏付けられた。
  • 特徴量重要度分析から、モーメント特徴量は個別ではやや優位性に欠けるものの、基本統計および追加統計と組み合わせることで、性能向上に顕著な貢献を示した。
  • エンティティベース分類スキームは、データの不均衡と不足の問題を抱えており、より大規模でバランスの取れたデータセットがなければスケーラビリティに制限が生じる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。