Skip to main content
QUICK REVIEW

[論文レビュー] EnsemFDet: An Ensemble Approach to Fraud Detection based on Bipartite Graph

Yuxiang Ren, Hao Zhu|arXiv (Cornell University)|Dec 23, 2019
Imbalanced Data Classification Techniques参考文献 38被引用数 11
ひとこと要約

EnsemFDet は、大規模なプロモーションキャンペーン詐欺検出を並列な部分グラフ抽出と投票に分解することで、スケーラビリティと精度を向上させる、二部グラフ向けのアンサンブル型詐欺検出フレームワークである。JD.comの実際の電子商取引データにおいて、最先端の手法と比較して最大100倍の高速化を達成しながら、高い正確性と再現率を維持している。

ABSTRACT

Fraud detection is extremely critical for e-commerce business. It is the intent of the companies to detect and prevent fraud as early as possible. Existing fraud detection methods try to identify unexpected dense subgraphs and treat related nodes as suspicious. Spectral relaxation-based methods solve the problem efficiently but hurt the performance due to the relaxed constraints. Besides, many methods cannot be accelerated with parallel computation or control the number of returned suspicious nodes because they provide a set of subgraphs with diverse node sizes. These drawbacks affect the real-world applications of existing methods. In this paper, we propose an Ensemble-based Fraud Detection (EnsemFDet) method to scale up fraud detection in bipartite graphs by decomposing the original problem into subproblems on small-sized subgraphs. By oversampling the graph and solving the subproblems, the ensemble approach further votes suspicious nodes without sacrificing the prediction accuracy. Extensive experiments have been done on real transaction data from JD.com, which is one of the world's largest e-commerce platforms. Experimental results demonstrate the effectiveness, practicability, and scalability of EnsemFDet. More specifically, EnsemFDet is up to 100x faster than the state-of-the-art methods due to its parallelism with all aspects of data.

研究の動機と目的

  • ラベル付きデータの不足により教師あり学習が不適切となる大規模な電子商取引プラットフォームにおけるプロモーションキャンペーン詐欺検出の課題に対処すること。
  • スペクトル的およびヒューリスティックな詐欺検出手法の限界、すなわちスケーラビリティの低さ、並列処理の弱さ、性能の不安定さを克服すること。
  • 進化する詐欺パターンを伴う動的で一時的なプロモーションキャンペーンを扱える、スケーラブルで安定的かつ正確な詐欺検出システムを設計すること。
  • グラフをより小さな部分グラフに分解し、アンサンブル投票によって結果を集約することで、効率的で並列的かつ適応可能な詐欺検出を可能にすること。

提案手法

  • この手法は、ユーザーとマーチャント間の取引関係を表す二部グラフ上で、プロモーションキャンペーン詐欺検出を最適化問題として定式化する。
  • 元のグラフを複数の小さな部分グラフにオーバーサンプリングするアンサンブルフレームワークを採用し、並列処理を可能にする。
  • 新しいヒューリスティックアルゴリズム FDet を導入し、手動でのハイパーパramータチューニングを必要とせずに、自動的に詐欺サブグラフの数を特定する。
  • FDet は、検出精度を保持したままサブグラフ検出を高速化するための効率的な切断戦略を用いる。
  • すべてのサンプルド部分グラフにわたる投票によって、疑わしいノードを同定し、精度と再現率のバランスを取るために設定可能な閾値 T を用いる。
  • 性能、スケーラビリティ、計算コストのバランスを取るために、動的にサンプリングサイズ (S) と繰り返し率 (N) を調整する。

実験結果

リサーチクエスチョン

  • RQ1ラベル付きデータに依存せずに、大規模で動的な電子商取引プロモーションキャンペーンにおける詐欺検出をどのようにスケーラブルかつ効率的に実現できるか。
  • RQ2アンサンブル型サンプリングと投票は、単一手法に比べて、どの程度検出精度と安定性を向上させることができるか。
  • RQ3サンプリングサイズ (S)、繰り返し率 (N)、および投票閾値 (T) が、詐欺検出システムの性能と耐障害性にどのように影響を与えるか。
  • RQ4提案手法は、最先端の手法と比較して、実世界のシナリオにおいて顕著な高速化を達成しながらも、高い正確性と再現率を維持できるか。

主な発見

  • EnsemFDet は、非常に並列処理に適した設計と効率的な部分グラフサンプリングにより、最先端の手法と比較して最大100倍の高速化を達成している。
  • さまざまなパramータ設定においても高い正確性と再現率を維持しており、サンプリングサイズ (S) を元のグラフの1%にまで低下させても安定した性能を示している。
  • FDet アルゴリズムは、サブグラフ数の手動チューニングを必要とせず、ユーザビリティを向上させるとともにハイパーパramータ依存性を低減している。
  • 閾値 T を用いた投票メカニズムにより、正確性と再現率の滑らかなトレードオフが可能となり、アプリケーション固有のニーズに応じたシステムチューニングが可能である。
  • N および S の異なる値に対しても EnsemFDet は頑健で安定しており、コア数の異なる多様な計算環境に適応可能である。
  • この手法は JD.com のリスク制御システムに実際に導入され、実用性と実世界での有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。