Skip to main content
QUICK REVIEW

[論文レビュー] Applying support vector data description for fraud detection

Mohamad Khedmati, Masoud Erfani|arXiv (Cornell University)|May 31, 2020
Imbalanced Data Classification Techniques参考文献 6被引用数 4
ひとこと要約

本稿では、入手が難しいラベル付き不正取引データを必要としないために、サポートベクターデータ記述(SVDD)を用いたワンクラス不正検出フレームワークを提案する。不正検出に用いる訓練データを削減しながらもデータの形状を保持するよう最適化されたDBSCANの拡張版であるREDBSCANを導入し、SVDDの訓練を著しく高速化する。本手法はAUC 0.9775を達成し、従来のSVMと比較して精度と速度の両面で優れた性能を示した。訓練に使用した非不正データは全体の10%にとどまった。

ABSTRACT

Fraud detection is an important topic that applies to various enterprises such as banking and financial sectors, insurance, government agencies, law enforcement, and more. Fraud attempts have been risen remarkably in current years, shaping fraud detection an essential topic for research. One of the main challenges in fraud detection is acquiring fraud samples which is a complex and challenging task. In order to deal with this challenge, we apply one-class classification methods such as SVDD which does not need the fraud samples for training. Also, we present our algorithm REDBSCAN which is an extension of DBSCAN to reduce the number of samples and select those that keep the shape of data. The results obtained by the implementation of the proposed method indicated that the fraud detection process was improved in both performance and speed.

研究の動機と目的

  • ラベル付き不正取引データの収集が困難である現実の不正検出システムにおける課題に対処すること。
  • 非不正訓練データのサイズを削減することで、データ分布の特性を損なわず、不正検出の効率と性能を向上させること。
  • 従来の二クラス分類器(例:SVM)と比較して、ワンクラス分類(特にSVDD)が不正検出において果たす有効性を評価すること。
  • DBSCANの拡張版としての新規なデータ削減アルゴリズムREDBSCANの開発と検証を行い、訓練速度の向上とモデルの汎化性能の向上を図ること。

提案手法

  • 著者らは、非不正データポイントのみを用いて正常データの境界を学習するワンクラス分類手法であるサポートベクターデータ記述(SVDD)を適用する。
  • 非不正データから代表的なサンプルを選択しながらも、元のデータ構造を保持するように最適化されたDBSCANの拡張版であるREDBSCANを導入する。
  • REDBSCANで得られた非不正データの縮小版データセットを用いてSVDDモデルを訓練し、訓練速度とメモリ効率を向上させる。
  • 合成されたモバイル決済データセットを用いて、AUC、適合率、再現率、F-measureなどの指標を用いてSVDDと従来のSVMの性能を比較する。
  • SVDDの実装には、D.M.J. Taxが開発したMATLABツールボックス(dd-toolsとpr-tools)を用いる。
  • SVDDとSVMの評価には30%のテストセットを用い、SVDDは非不正データの10%のみで訓練されたが、SVMは全データセット(不正データ含む)の70%で訓練された。

実験結果

リサーチクエスチョン

  • RQ1SVDDを用いたワンクラス分類は、ラベル付き不正データを一切必要としない状況でも高い不正検出性能を達成できるか?
  • RQ2提案されたREDBSCANアルゴリズムは、データ分布の整合性を保ちつつ、データ削減の効率をどのように向上させるか?
  • RQ3最小限の非不正データで訓練された場合、SVDDはAUC、適合率、再現率、F-measureの観点で従来の二クラスSVMに比べてどの程度の性能向上を示すか?
  • RQ4REDBSCANによるデータ削減は、モデル性能を劣化させることなく、SVDDの訓練速度をどの程度向上させるか?

主な発見

  • SVDDは非不正データの10%でのみ訓練されたにもかかわらず、AUC 0.9775を達成し、SVMのAUC 0.9460を著しく上回った。
  • SVDDの適合率は0.9194であったのに対し、SVMは0.8441であった。これは、真の不正取引の特定がより優れていることを示している。
  • SVDDの再現率は0.8557であり、SVMの0.7550を上回った。これは、実際に存在する不正取引の検出能力が向上していることを示している。
  • F-measureにおいてSVDDは0.8864を達成し、SVMの0.7971を上回った。これは、分類のバランスが全体的に優れていることを確認している。
  • REDBSCANによるデータ削減を適用した場合、SVDDの訓練時間は194秒から1.69秒にまで短縮され、顕著な高速化が実現された。
  • SVMの訓練データサイズをSVDDと同等の10%にまで削減した場合、AUCは低下したが、SVDDのAUCは安定を保った。これはワンクラスアプローチのロバスト性を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。