Skip to main content
QUICK REVIEW

[論文レビュー] RCC-Dual-GAN: An Efficient Approach for Outlier Detection with Few Identified Anomalies

Zhe Li, Chunhua Sun|arXiv (Cornell University)|Mar 7, 2020
Anomaly Detection Techniques and Applications参考文献 42被引用数 4
ひとこと要約

本稿では、少数の特定済み異常を活用して離散的およびグループ異常を効率的に検出できる半教師あり異常検出手法RCC-Dual-GANを提案する。RCC(ロバスト連続クラスタリング)と修正されたGANアーキテクチャ(M-GAN)を統合することで、特に低ラベル状況下でもベースラインGANよりも検出精度と安定性が向上し、クレジットカード不正利用やネットワーク侵入検出といった実世界のデータセットにおいて、教師ありおよび教師なしのベースラインを上回る性能を発揮する。

ABSTRACT

Outlier detection is an important task in data mining and many technologies have been explored in various applications. However, due to the default assumption that outliers are non-concentrated, unsupervised outlier detection may not correctly detect group anomalies with higher density levels. As for the supervised outlier detection, although high detection rates and optimal parameters can usually be achieved, obtaining sufficient and correct labels is a time-consuming task. To address these issues, we focus on semi-supervised outlier detection with few identified anomalies, in the hope of using limited labels to achieve high detection accuracy. First, we propose a novel detection model Dual-GAN, which can directly utilize the potential information in identified anomalies to detect discrete outliers and partially identified group anomalies simultaneously. And then, considering the instances with similar output values may not all be similar in a complex data structure, we replace the two MO-GAN components in Dual-GAN with the combination of RCC and M-GAN (RCC-Dual-GAN). In addition, to deal with the evaluation of Nash equilibrium and the selection of optimal model, two evaluation indicators are created and introduced into the two models to make the detection process more intelligent. Extensive experiments on both benchmark datasets and two practical tasks demonstrate that our proposed approaches (i.e., Dual-GAN and RCC-Dual-GAN) can significantly improve the accuracy of outlier detection even with only a few identified anomalies. Moreover, compared with the two MO-GAN components in Dual-GAN, the network structure combining RCC and M-GAN has greater stability in various situations.

研究の動機と目的

  • 密なグループ異常を検出する際の教師なし異常検出の限界を解消すること。
  • 教師あり手法の高いラベル付けコストを低減するため、わずかな数の特定済み異常を活用すること。
  • 周囲の近隣や類似度計算にかかるコストを回避し、特定済み異常から得られる潜在的情報を直接活用するワンステップの半教師あり手法を開発すること。
  • 新規のRCC-M-GAN統合により、複雑なデータ構造においてモデルの安定性と検出精度を向上させること。
  • トレーニング中にナッシュ均衡とモデル選択を評価するための知的評価指標(NNRおよびAP)を導入すること。

提案手法

  • 識別済み異常を直接活用して離散的および部分的に特定済みのグループ異常を検出できるワンステップの半教師ありモデルであるDual-GANを提案する。
  • Dual-GAN内の二つのMO-GANコンponentsを、ロバスト連続クラスタリング(RCC)とM-GANの組み合わせに置き換えることで、複雑なデータ構造における安定性を向上させる。
  • トレーニング中にナッシュ均衡の評価とモデル選択を支援する二つの指標(NNR(最近傍比)およびAP(平均適合度))を導入する。
  • 識別済み異常を基準点として用い、基準分布を構築することで、少数クラスの強化をより堅牢に実現する。
  • 二重判別器ジェネレータフレームワークを採用し、一方の判別器は通常データに、もう一方は異常データに焦点を当てるようにすることで、検出感度を向上させる。
  • 調整済みのNSL-KDDおよびクレジットカードデータセットを用いて、クレジットカード不正検出やネットワーク侵入検出といった実世界のタスクに本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1少数の特定済み異常しか利用できない状況下でも、半教師あり異常検出モデルが高精度を達成できるか?
  • RQ2類似度や近隣計算を明示的に実行せずに、識別済み異常を有効活用して離散的およびグループ異常を検出できるか?
  • RQ3RCCとM-GANを統合することで、標準的なMO-GANコンponentsと比較してモデルの安定性と検出性能が向上するか?
  • RQ4NNRおよびAPは、GANベースの異常検出におけるモデル選択とナッシュ均衡評価の信頼性のある指標として機能するか?
  • RQ5限られたラベル付き異常を有する状況下で、クレジットカード不正検出やネットワーク侵入検出といった実世界の応用において、本手法はどの程度の性能を発揮するか?

主な発見

  • RCC-Dual-GANは、クレジットカードおよびNSL-KDDデータセットの両方で最高の検出精度を達成し、教師なしおよび教師ありのベースラインを上回った。
  • クレジットカードデータセットでは、RCC-Dual-GANとDual-GANが、たとえ全体の不正取引の0.1%にあたる33件の不正取引しかラベルされていなくても、著しく検出性能が向上した。
  • 教師ありSup-GANは、教師なしのk-NNおよびLOFよりも性能が悪く、単一のGANでは複数の異常生成メカニズムを同時に学習するのが困難であることが示された。
  • Sup-RCC-GANは最適でない結果を示したため、異常タイプが多様な状況では、限られた数の特定済み異常を用いた教師あり微調整が一般化しにくい可能性がある。
  • RCC-Dual-GANは、元のDual-GAN(MO-GANコンponentsを搭載)と比較して、異なるデータ分布や異常タイプにおいてより高い安定性を示した。
  • NNRおよびAP指標の活用により、より信頼性の高いモデル選択と収束が可能になり、検出プロセス全体の頑健性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。