[論文レビュー] One-Class Adversarial Nets for Fraud Detection
本稿では、悪意あるユーザーを検出するために良性ユーザーのデータのみを用いる、新規の不正検出フレームワークであるOne-Class Adversarial Nets (OCAN) を提案する。OCANは、時系列的なオンライン行動からユーザー表現を学習するためのLSTM-Autoencoderを採用し、その後、良性行動の低密度領域で悪意のあるサンプルを生成する生成器と、実際の良性ユーザーとこれらの補完的サンプルを区別する判別器からなる補完的GANを用いる。このアプローチにより、1クラス不正検出ベンチマークで最先端の性能を達成する。
Many online applications, such as online social networks or knowledge bases, are often attacked by malicious users who commit different types of actions such as vandalism on Wikipedia or fraudulent reviews on eBay. Currently, most of the fraud detection approaches require a training dataset that contains records of both benign and malicious users. However, in practice, there are often no or very few records of malicious users. In this paper, we develop one-class adversarial nets (OCAN) for fraud detection using training data with only benign users. OCAN first uses LSTM-Autoencoder to learn the representations of benign users from their sequences of online activities. It then detects malicious users by training a discriminator with a complementary GAN model that is different from the regular GAN model. Experimental results show that our OCAN outperforms the state-of-the-art one-class classification models and achieves comparable performance with the latest multi-source LSTM model that requires both benign and malicious users in the training phase.
研究の動機と目的
- 訓練時に悪意あるユーザーのデータが入手できない状況における不正検出の課題に対処すること。
- ラベル付き悪意ある例が不要な状態で、悪意あるユーザー行動をシミュレートできる生成モデルを開発すること。
- 標準的なGAN学習ではなく、補完的サンプル生成を活用することで、1クラス設定における検出精度を向上させること。
- ユーザー行動の時系列をモデル化することで、動的かつ逐次的な不正検出を可能にすること。
提案手法
- 良性ユーザーの時系列を圧縮・低次元表現に変換するため、LSTM-Autoencoderを活用する。
- 生成器が良性ユーザー表現の補完的領域(低密度領域)に位置するサンプルを生成する、補完的GANフレームワークを導入する。
- 判別器を、実際の良性ユーザーと生成された補完的サンプルを分類するように訓練し、これにより外れ値(潜在的な悪意あるユーザー)を検出可能にする。
- 訓練済みの判別器を最終分類器として用い、新しいユーザーの行動時系列に基づき、良性または不正であるかを予測する。
- 時系列データ(例:編集履歴)および数値的取引データを処理するため、オートエンコーダの構造をそれに応じて適応させる。
- クラスタリングと重心距離解析を用いて、表現空間において悪意あるユーザーと良性ユーザーが分離されていることを検証する。
実験結果
リサーチクエスチョン
- RQ1良性ユーザーのデータのみが利用可能な状況で、生成モデルが悪意あるユーザー行動を効果的にシミュレートできるか。
- RQ21クラスの状況において、潜在空間における補完的サンプル生成は、標準的なGANと比較して不正検出性能をどのように向上させるか。
- RQ3訓練時にラベル付き悪意ある例が不要なOCANが、M-LSTMのような教師ありモデルと同等の性能を達成できるか。
- RQ4OCANは、さまざまなデータタイプにおいて、破壊的行為やクレジットカード不正など、多様な種類の不正に一般化できるか。
- RQ5実世界の不正検出で一般的な不均衡データセットにおいて、OCANは高い性能を維持できるか。
主な発見
- OCANは、Wikipediaの破壊的行為検出およびクレジットカード不正検出の両データセットにおいて、最先端の1クラス分類モデルを上回る性能を示した。
- Wikipediaデータセットでは、F1スコア0.886、AUC 0.943を達成し、既存の1クラス手法を上回った。
- クレジットカード不正検出データセットでは、取引表現を用いてAUC 0.9750を達成し、すべてのベースラインを上回った。
- OCANは不均衡データでも強力な性能を維持し、生の特徴量を用いた場合AUC 0.9645、学習済み表現を用いた場合AUC 0.9750を達成した。
- 時系列的な編集パターンをモデル化することで、破壊者を早期に検出でき、M-LSTMと同等の精度を発揮したが、その際には良性および悪意ある訓練データの両方が必要であった。
- 距離解析の結果、実際の良性ユーザーの重心から破壊者の距離は3.888であったのに対し、補完的サンプルまでの距離は3.6346であった。これにより、判別器が悪意あるユーザーを正しく分離できていることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。