Skip to main content
QUICK REVIEW

[論文レビュー] DeepCapture: Image Spam Detection Using Deep Learning and Data Augmentation

Bedeuro Kim, Alsharif Abuadbba|arXiv (Cornell University)|Jun 16, 2020
Spam and Phishing Detection参考文献 19被引用数 7
ひとこと要約

DeepCaptureは、タスク固有のデータ拡張を組み込んだCNN-XGBoostモデルを提案し、画像スパム検出の性能を向上させた。F1スコアは88%に達し、既存で最高のモデル(CNN-SVM)より6ポイント高い。本手法は、スパム画像の多様な訓練サンプルを生成するための特化した拡張技術を用いることで、未確認のスパム画像に対しても耐性を高めた。

ABSTRACT

Image spam emails are often used to evade text-based spam filters that detect spam emails with their frequently used keywords. In this paper, we propose a new image spam email detection tool called DeepCapture using a convolutional neural network (CNN) model. There have been many efforts to detect image spam emails, but there is a significant performance degrade against entirely new and unseen image spam emails due to overfitting during the training phase. To address this challenging issue, we mainly focus on developing a more robust model to address the overfitting problem. Our key idea is to build a CNN-XGBoost framework consisting of eight layers only with a large number of training samples using data augmentation techniques tailored towards the image spam detection task. To show the feasibility of DeepCapture, we evaluate its performance with publicly available datasets consisting of 6,000 spam and 2,313 non-spam image samples. The experimental results show that DeepCapture is capable of achieving an F1-score of 88%, which has a 6% improvement over the best existing spam detection model CNN-SVM with an F1-score of 82%. Moreover, DeepCapture outperformed existing image spam detection solutions against new and unseen image datasets.

研究の動機と目的

  • 完全に新しい未確認のスパムデータセットに対して、既存の画像スパム検出器の性能低下を解消すること。
  • 限定的または不均衡な画像スパムデータセットで学習されたディープラーニングモデルの過学習を克服すること。
  • 最小限のハイパーパrameterで最適化された、耐性があり軽量なCNN-XGBoostフレームワークを構築すること。
  • 画像スパムの特徴に合わせたタスク固有のデータ拡張技術を導入することで、一般化性能を向上させること。
  • 未確認のスパムデータセットを含むクロスデータトレーニングのシナリオにおいて、優れた性能を示すこと。

提案手法

  • ハイパーパramータチューニング(フィルタ数、フィルターサイズ、活性化関数、エポック数、バッチサイズ)を用いて、画像スパム検出に最適化された8層のディープCNNアーキテクチャを設計する。
  • CNNの最終特徴量の上にXGBoostを分類器として統合し、意思決定境界の改善と一般化性能の向上を図る。
  • 画像回転、スケーリング、カラーのジャミング、ノイズ注入などの、画像スパムに特化したデータ拡張技術を適用し、訓練の多様性を高める。
  • ハム(ham)クラスの少数クラスを拡張することで、トレーニングデータセットのバランスを取ることで、モデルの耐性を向上させる。
  • 公開済みのデータセット(スパム6,000件、ハム2,313件)を用いてトレーニングと評価を実施し、一般化性能を検証するクロスデータトレーニングのシナリオを設定する。
  • ドメイン内およびドメイン外(未確認)のデータセットにおいて、F1スコア、適合率、再現率を用いてモデルの性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1タスク固有のデータ拡張を施したCNN-XGBoostモデルは、F1スコアの観点から、既存の画像スパム検出モデルを上回ることができるか?
  • RQ2データ拡張は、完全に新しい未確認の画像スパムデータセットにおけるモデルの一般化性能にどのように影響するか?
  • RQ3テストデータがトレーニングデータの分布と異なるクロスデータトレーニングのシナリオにおいても、本モデルは高い性能を維持できるか?
  • RQ4最小限の複雑性で画像スパム検出に最適なCNNアーキテクチャとハイパーパramータの最適な設定は何か?
  • RQ5データ拡張は、画像スパム検出における過学習をどの程度軽減し、耐性を向上させるか?

主な発見

  • DeepCaptureはF1スコア88%を達成し、既存で最高のモデル(CNN-SVM、82%)より6ポイント高い。
  • 完全に新しい未確認のスパムデータセットを含むクロスデータトレーニングのシナリオにおいて、DeepCaptureは最高のF1スコアを維持し、他のすべての分類器を上回った。
  • データ拡張を実施しない場合、クロスデータシナリオにおけるすべての分類器がF1スコア40%未満にとどまり、耐性確保のための拡張の必要性が浮き彫りになった。
  • データ拡張の統合により、特に未確認のスパムサンプルにおいてモデルの一般化性能が著しく向上し、過学習が軽減された。
  • 8層というわずかな層数のCNN-XGBoostフレームワークが、13層のCNN-SVMよりも優れた性能を示した。これは、効率性と有効性を示している。
  • 本モデルは実世界の画像スパムデータセットにおいても強く優れた性能を示し、スパムフィルタリングシステムへの実用的・実装可能性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。