Skip to main content
QUICK REVIEW

[論文レビュー] Spectrum-based deep neural networks for fraud detection

Shuhan Yuan, Xintao Wu|arXiv (Cornell University)|Jun 3, 2017
Imbalanced Data Classification Techniques参考文献 11被引用数 8
ひとこと要約

本稿では、隣接行列の固有ベクトルから導出されるスペクトル座標を用いて、署名付きグラフにおける不正検出のためのスペクトルベースの深層学習フレームワークを提案する。ノードを低次元のスペクトル空間に射影し、1ステップの近隣ノードの座標と組み合わせることで、限られたラベル付きデータでも効果的な不正検出が可能となり、隣接行列ベースの手法を上回り、20%の訓練データを用いた場合に最大82.61%の精度を達成する。

ABSTRACT

In this paper, we focus on fraud detection on a signed graph with only a small set of labeled training data. We propose a novel framework that combines deep neural networks and spectral graph analysis. In particular, we use the node projection (called as spectral coordinate) in the low dimensional spectral space of the graph's adjacency matrix as input of deep neural networks. Spectral coordinates in the spectral space capture the most useful topology information of the network. Due to the small dimension of spectral coordinates (compared with the dimension of the adjacency matrix derived from a graph), training deep neural networks becomes feasible. We develop and evaluate two neural networks, deep autoencoder and convolutional neural network, in our fraud detection framework. Experimental results on a real signed graph show that our spectrum based deep neural networks are effective in fraud detection.

研究の動機と目的

  • 限られたラベル付き訓練データを前提とした署名付きグラフにおける不正検出の課題に対処すること。
  • スペクトルグラフ解析を活用することで、深層ニューラルネットワークにおける高次元入力問題を軽減すること。
  • 手作業で設計されたグラフ指標に依存せずに、トポロジカル構造を捉えるフレームワークを開発すること。
  • 正負のエッジ情報の両方を組み込むことで、署名付きネットワークにおける効果的な不正検出を実現すること。
  • 深層オートエンコーダー(DAE)および畳み込みニューラルネットワーク(CNN)が、スペクトル座標を入力として不正検出にどのように機能するかを評価すること。

提案手法

  • 署名付きグラフの隣接行列のスペクトル分解を用い、上位k個の固有ベクトルを抽出し、低次元のスペクトル空間を構築する。
  • 各ノードのスペクトル座標を、上位k個の固有ベクトルが張るk次元部分空間への射影として計算する。
  • 各ノードのスペクトル座標を、エッジの符号(正/負)で分離した1ステップの近隣ノードの平均スペクトル座標と組み合わせる。
  • 組み合わせたスペクトル入力を、エンドツーエンドの不正分類を目的とした深層オートエンコーダー(DAE)および畳み込みニューラルネットワーク(CNN)モデルに供給する。
  • 小規模な訓練データセットにおける性能向上を図るため、DAEに事前学習を適用し、学習済みの隠れ表現を活用する。
  • GPUを用いた高速トレーニングを実施し、スペクトル座標入力と隣接行列入力の間で効率性を比較する。

実験結果

リサーチクエスチョン

  • RQ1グラフの隣接行列から導出されるスペクトル座標は、署名付きグラフにおける不正検出のためのトポロジカル構造を効果的に表現できるか?
  • RQ2ノードのスペクトル座標と近隣ノードのスペクトル座標を組み合わせることで、不正検出の性能が向上するか?
  • RQ3スペクトル座標を入力として使用する際、深層ニューラルネットワーク(DAEおよびCNN)の性能は、完全な隣接行列を入力とした場合と比べてどうなるか?
  • RQ4スペクトル座標の次元数(k)を変化させた場合、検出精度およびモデルの安定性にどのような影響を与えるか?
  • RQ5訓練データセットのサイズが、スペクトル空間におけるDAEとCNNの相対的性能に与える影響は何か?

主な発見

  • 完全な隣接行列を入力とした場合と比較して、深層ニューラルネットワークにスペクトル座標を入力することで、特に5%および10%の訓練データ比において顕著に高い不正検出性能が達成された。
  • 20%の訓練データを用いた場合、CNNモデルはスペクトル座標を入力とすることで82.61%の精度を達成し、同じ入力に対してk-NN、SVM、DAEを上回った。
  • 5%程度の低訓練データ比では、DAEがCNNを上回った。これは、事前学習フェーズのおかげで、限られたラベル付き例でも一般化性能が向上したためである。
  • 訓練データが5%を超えると、スペクトル空間においてCNNがDAEを上回った。これは、十分なデータがある場合にCNNの能力が顕著に発揮されることを示している。
  • 1ステップの近隣ノードのスペクトル座標を組み込むことで、全モデルで1%〜2%の精度向上が見られ、局所的なトポロジカルな文脈の価値が裏付けられた。
  • スペクトル座標を用いた学習は、隣接行列を用いた学習よりも効率的であり、1エポックあたりの推論時間が1秒未満であった。一方、隣接行列入力では2秒を要した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。