Skip to main content
QUICK REVIEW

[논문 리뷰] DeepCapture: Image Spam Detection Using Deep Learning and Data Augmentation

Bedeuro Kim, Alsharif Abuadbba|arXiv (Cornell University)|2020. 06. 16.
Spam and Phishing Detection참고 문헌 19인용 수 7
한 줄 요약

DeepCapture는 작업에 특화된 데이터 증강 기법을 사용하는 CNN-XGBoost 모델을 제안하여 이미지 스팸 검출 성능을 향상시켰으며, 기존 최고 성능 모델(CNN-SVM)보다 6% 높은 88%의 F1 스코어를 달성했다. 이 방법은 맞춤형 증강 기법을 통해 다양한 훈련 샘플을 생성함으로써 미리 보지 못한 스팸 이미지에 대한 강건성을 향상시킨다.

ABSTRACT

Image spam emails are often used to evade text-based spam filters that detect spam emails with their frequently used keywords. In this paper, we propose a new image spam email detection tool called DeepCapture using a convolutional neural network (CNN) model. There have been many efforts to detect image spam emails, but there is a significant performance degrade against entirely new and unseen image spam emails due to overfitting during the training phase. To address this challenging issue, we mainly focus on developing a more robust model to address the overfitting problem. Our key idea is to build a CNN-XGBoost framework consisting of eight layers only with a large number of training samples using data augmentation techniques tailored towards the image spam detection task. To show the feasibility of DeepCapture, we evaluate its performance with publicly available datasets consisting of 6,000 spam and 2,313 non-spam image samples. The experimental results show that DeepCapture is capable of achieving an F1-score of 88%, which has a 6% improvement over the best existing spam detection model CNN-SVM with an F1-score of 82%. Moreover, DeepCapture outperformed existing image spam detection solutions against new and unseen image datasets.

연구 동기 및 목표

  • 완전히 새로운 스팸 이미지 데이터셋에 대해 기존 이미지 스팸 검출기의 성능 저하 문제를 해결하기 위해.
  • 제한적 또는 불균형한 이미지 스팸 데이터셋으로 훈련된 딥러닝 모델의 과적합 문제를 해결하기 위해.
  • 최소한의 하이퍼파라미터를 가진 강건하고 경량화된 CNN-XGBoost 프레임워크를 개발하여 이미지 스팸 검출에 최적화하기 위해.
  • 이미지 스팸 특성에 맞게 조정된 작업에 특화된 데이터 증강 기법을 도입하여 일반화 성능을 향상시키기 위해.
  • 새로운 스팸 데이터셋을 포함한 교차 데이터 훈련 시나리오에서 뛰어난 성능을 입증하기 위해.

제안 방법

  • 하이퍼파라미터 튜닝(필터 수, 필터 크기, 활성화 함수, 에포크 수, 배치 크기)을 통해 이미지 스팸 검출에 최적화된 8층의 딥 컨볼루션 신경망 아키텍처를 설계하기 위해.
  • CNN의 최종 특징에 위에 XGBoost 분류기를 통합하여 결정 경계를 개선하고 일반화 성능을 향상시키기 위해.
  • 이미지 회전, 스케일링, 색상 왜곡, 노이즈 주입 등의 작업에 특화된 데이터 증강 기법을 적용하여 훈련 샘플의 다양성을 높이기 위해.
  • 소수 클래스(ham)를 증강하여 훈련 데이터셋의 클래스 불균형을 완화하고 모델의 강건성을 향상시키기 위해.
  • 공개된 데이터셋(스팸 6,000개, 해머 2,313개)을 사용하여 훈련 및 평가를 수행하고, 일반화 성능을 테스트하기 위해 교차 데이터 훈련 시나리오를 적용하기 위해.
  • 도메인 내 및 도메인 외(미리 보지 못한) 데이터셋에서 F1 스코어, 정밀도, 재현율을 사용하여 모델 성능을 평가하기 위해.

실험 결과

연구 질문

  • RQ1작업에 특화된 데이터 증강 기법을 적용한 CNN-XGBoost 모델이 F1 스코어 측면에서 기존 이미지 스팸 검출 모델을 능가할 수 있는가?
  • RQ2데이터 증강은 완전히 새로운 스팸 이미지 데이터셋에서 모델의 일반화 성능에 어떤 영향을 미치는가?
  • RQ3학습 데이터 분포와 다를 경우 테스트 데이터를 포함한 교차 데이터 훈련 시나리오에서 제안된 모델이 높은 성능을 유지하는가?
  • RQ4최소한의 복잡도로 이미지 스팸 검출에 최적화된 CNN 아키텍처 및 하이퍼파라미터의 최적 설정은 무엇인가?
  • RQ5데이터 증강은 과적합을 어느 정도 감소시키고 이미지 스팸 검출의 강건성을 어느 정도 향상시키는가?

주요 결과

  • DeepCapture는 F1 스코어 88%를 달성하였으며, 이는 기존 최고 성능 모델인 CNN-SVM(82%)보다 6% 높은 성능이다.
  • 완전히 새로운 스팸 데이터셋을 포함한 교차 데이터 훈련 시나리오에서 DeepCapture는 모든 다른 분류기보다 가장 높은 F1 스코어를 유지하며 뛰어난 성능을 보였다.
  • 데이터 증강 없이 테스트한 모든 분류기는 교차 데이터 시나리오에서 F1 스코어가 40% 이하에 머물렀으며, 이는 강건성을 확보하기 위해 증강 기법이 필수적임을 시사한다.
  • 데이터 증강의 통합은 특히 미리 보지 못한 스팸 샘플에서의 일반화 성능 향상에 기여하였으며, 과적합을 줄이는 데에도 효과적이었다.
  • 단지 8층으로 구성된 CNN-XGBoost 프레임워크가 13층의 CNN-SVM보다 뛰어난 성능을 보이며 효율성과 효과성을 입증하였다.
  • 모델는 실제 세계의 이미지 스팸 데이터셋에서 뛰어난 성능을 보이며, 스팸 필터링 시스템에 구현 가능한 실용성과 타당성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.