[論文レビュー] Synthetic Data Generation for Fraud Detection using GANs
本論文では、オンラインカジノにおける不正検出におけるクラス不均衡問題に対処するため、合成データ生成に生成対抗ネットワーク(GAN)を用いたSDG-GANというフレームワークを提案する。少数クラス(不正)インスタンスの高品質な合成により、分類器の性能が著しく向上し、ルールベースのシステムに比べてF1スコアで5%の向上を達成。また、SMOTE、ADASYN、B-SMOTE、cGANを上回る性能を示した。ベンチマークおよび実世界のカジノ不正データセットで評価された。
Detecting money laundering in gambling is becoming increasingly challenging for the gambling industry as consumers migrate to online channels. Whilst increasingly stringent regulations have been applied over the years to prevent money laundering in gambling, despite this, online gambling is still a channel for criminals to spend proceeds from crime. Complementing online gambling's growth more concerns are raised to its effects compared with gambling in traditional, physical formats, as it might introduce higher levels of problem gambling or fraudulent behaviour due to its nature of immediate interaction with online gambling experience. However, in most cases the main issue when organisations try to tackle those areas is the absence of high quality data. Since fraud detection related issues face the significant problem of the class imbalance, in this paper we propose a novel system based on Generative Adversarial Networks (GANs) for generating synthetic data in order to train a supervised classifier. Our framework Synthetic Data Generation GAN (SDG-GAN), manages to outperformed density based over-sampling methods and improve the classification performance of benchmarks datasets and the real world gambling fraud dataset.
研究の動機と目的
- オンラインカジノにおける不正検出において、不正事例が正当な事例に比べて著しく少ないという深刻なクラス不均衡問題に対処すること。
- 不均衡で構造化されたデータセットにおいて、教師あり学習の性能を向上させる耐性のある合成データ生成手法を開発すること。
- 従来の手法と対照的なアドバーシャルサンプリング手法と比較して、実世界の不正検出シナリオにおけるGANベースのオーバーサンプリングの有効性を評価すること。
- より良いデータ拡張により、オンラインカジノプラットフォームにおける高リスクのマネーロンダリング事例の特定率を向上させること。
- 本手法を公開ベンチマークデータセットおよび実世界の匿名カジノ不正データセットの両方で検証すること。
提案手法
- SDG-GANは、少数クラス(不正)インスタンスの合成を目的とした条件付きGANアーキテクチャを採用し、元のデータ分布を保持する。
- 生成器ネットワークは、本物のデータと偽物のデータを区別するように訓練された識別器との敵対的損失を最小化することで、現実的で信頼性の高い合成サンプルを学習する。
- このフレームワークは、教師あり学習パイプラインに統合されており、分類器の学習前に少数クラスを合成サンプルでオーバーサンプリングする。
- 4つの分類器(ロジスティック回帰(LR)、ランダムフォレスト(RF)、マルチレイヤーパーセプトロン(MLP)、XGBoost(XGB))を用いて評価した。
- 性能はF1スコア、適合率、再現率で測定され、SMOTE、ADASYN、B-SMOTE、cGANと比較するための統計的順位付けが行われた。
- モデルは、公開データセット(クレジットカード不正、ブレストキャンサー・ウィスコンシン、ピマ糖尿病)および、全4,700件のうち1,200件が高リスクケースである実世界のカジノ不正データセットで訓練された。
実験結果
リサーチクエスチョン
- RQ1GANベースの合成データ生成手法は、不均衡な不正検出データセットにおいて、教師あり分類器の性能を有効に向上させることができるか?
- RQ2SDG-GANは、SMOTE、ADASYN、B-SMOTEといった既存のオーバーサンプリング手法と比較して、F1スコアおよび分類の信頼性において優れているか?
- RQ3SDG-GANの使用により、実世界のオンラインカジノデータにおける高リスクのマネーロンダリング事例の特定に顕著な改善が見られるか?
- RQ4SDG-GANは、従来手法や他のGANベース手法と比較して、構造化された不正データに内在する複雑な非線形パターンをより効果的に捉えた高品質な合成データを生成できるか?
- RQ5SDG-GANの性能向上は、異なる機械学習モデルおよび多様なデータ分布において一貫しているか?
主な発見
- SDG-GANは、全分類器およびデータセットにおいて最高の全体順位(平均順位2.6)を達成し、SMOTE、ADASYN、B-SMOTE、cGANを上回った。
- 実世界のカジノ不正データセットでは、XGBoostと組み合わせたSDG-GANがF1スコアを89.73%まで向上させ、既存のルールベースシステムに比べて5%の向上を達成した。
- ベースライン手法と比較して、偽陽性と偽陰性の両方を低減し、正常顧客と高リスク顧客を区別する能力が向上した。
- ランダムフォレストを用いた場合、3つのベンチマークデータセットのうち2つで他の手法を上回り、その場合のF1スコアが最高となった。
- カジノ不正データセットでは、SMOTEに比べてF1スコアが約0.4%向上した。これは、段階的ではあるが一貫した改善を示している。
- 結果は、SDG-GANが複雑なデータ分布を効果的に推定でき、不均衡な不正検出タスクにおける少数クラスの検出性能を向上させられることを支持している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。