[논문 리뷰] Hybrid Deep Learning Model using SPCAGAN Augmentation for Insider Threat Analysis
이 논문은 선형 다중체 학습 기반 GAN과 새로운 손실 함수를 결합한 하이브리드 딥 러닝 모델인 SPCAGAN을 제안한다. 이 모델은 클래스 불균형 문제를 해결하고 이상 탐지 성능을 향상시키며 고품질의 합성 내부 위협 데이터를 생성한다. 제안된 방법은 최신 기술 대비 뛰어난 성능을 보이며, SPCAGAN은 모드 붕괴를 줄이고 기준 데이터셋에서 탐지 정확도를 향상시킨다.
Cyberattacks from within an organization's trusted entities are known as insider threats. Anomaly detection using deep learning requires comprehensive data, but insider threat data is not readily available due to confidentiality concerns of organizations. Therefore, there arises demand to generate synthetic data to explore enhanced approaches for threat analysis. We propose a linear manifold learning-based generative adversarial network, SPCAGAN, that takes input from heterogeneous data sources and adds a novel loss function to train the generator to produce high-quality data that closely resembles the original data distribution. Furthermore, we introduce a deep learning-based hybrid model for insider threat analysis. We provide extensive experiments for data synthesis, anomaly detection, adversarial robustness, and synthetic data quality analysis using benchmark datasets. In this context, empirical comparisons show that GAN-based oversampling is competitive with numerous typical oversampling regimes. For synthetic data generation, our SPCAGAN model overcame the problem of mode collapse and converged faster than previous GAN models. Results demonstrate that our proposed approach has a lower error, is more accurate, and generates substantially superior synthetic insider threat data than previous models.
연구 동기 및 목표
- 제한된 실세계 데이터로 인해 발생하는 내부 위협 탐지의 클래스 불균형 문제를 해결한다.
- 모델의 일반화 능력을 향상시키기 위해 다양한 고해상도의 합성 내부 위협 인스턴스를 생성하는 데이터 증강 방법을 개발한다.
- 하이브리드 베이지안 신경망(BNN)과 GAN 기반 훈련을 통해 이상 탐지 성능과 적대적 강건성을 향상시킨다.
- 기존 GAN의 한계, 예를 들어 모드 붕괴와 느린 수렴 문제를 극복한다.
- 기준 데이터셋에서 합성 데이터 품질과 이상 탐지 성능을 체계적으로 평가한다.
제안 방법
- 선형 다중체 학습 기반 정규화를 통합한 수정된 보조 분류기 GAN(ACGAN)인 SPCAGAN을 제안하여 생성기 훈련을 향상시킨다.
- 생성기가 내재된 데이터 다중체를 학습하도록 유도하는 새로운 손실 함수를 통합하여 데이터 다양성과 분포 충실도를 향상시킨다.
- 이질적인 소스에서 진짜 데이터 분포를 학습하도록 도와주기 위해 선형 내재 차원 수치를 활용한다.
- 합성 데이터를 활용한 적대적 훈련을 통해 이상 예측에 대한 모델 강건성을 향상시킨다.
- SPCAGAN가 생성한 데이터와 하이브리드 베이지안 신경망(BNN)을 결합하여 종단 간 이상 탐지 시스템을 구축한다.
- 실제 데이터와 합성 데이터 분포 간 유사도 평가를 위해 시각화 기법(KDE, PCA, t-SNE)을 활용한다.

실험 결과
연구 질문
- RQ1실제 데이터에 의존하지 않고도 GAN 기반 데이터 증강 방법이 내부 위협 탐지에서 클래스 불균형 문제를 효과적으로 줄일 수 있는가?
- RQ2선형 다중체 학습 통합이 합성 내부 위협 데이터의 품질과 다양성에 어떤 영향을 미치는가?
- RQ3SPCAGAN이 기존 GAN 대비 모드 붕괴를 피하고 더 빠르게 수렴하는 데까지 어느 정도 성능을 발휘하는가?
- RQ4SPCAGAN가 생성한 데이터로 훈련된 하이브리드 BNN 모델이 최신 기술 대비 이상 탐지 성능을 더 뛰어나게 하는가?
- RQ5특성 공간 기하학적 측면에서 합성 데이터 분포가 원본 데이터 분포와 얼마나 유사한가?
주요 결과
- SPCAGAN는 CERT v5.2 데이터셋에서 F1-스코어 0.668을 기록하여 CGAN, WGAN-GP, ACGAN를 포함한 모든 베이스라인 방법을 앞서며 최고 성능을 보였다.
- t-SNE 시각화를 통해 소수의 내부 위협 활동에 대해 잘 분리된 클러스터가 관찰되어 수렴 속도가 빠르고 모드 붕괴가 완전히 제거된 것으로 확인되었다.
- 핵밀도 추정 및 여러 특성에 대한 PCA/t-SNE 시각화를 통해 SPCAGAN가 생성한 합성 데이터는 실제 데이터와 높은 분포 유사도를 보였다.
- SPCAGAN 데이터로 훈련된 하이브리드 BNN 모델은 CERT v5.2에서 매크로 F1-스코어 0.917을 기록하여 소수 클래스에 대한 뛰어난 성능을 보였다.
- SPCAGAN가 생성한 데이터를 활용한 적대적 훈련은 모델의 강건성을 향상시켜 적대적 변형에 대한 취약성을 감소시켰다.
- 제안된 방법은 CERT v5.2 데이터셋에서 F1-스코어 3.868를 기록하여 ACGAN(F1=0.621)과 WGAN-GP(F1=0.674)와 같은 기존 방법들을 크게 앞서는 성능을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.