Skip to main content
QUICK REVIEW

[논문 리뷰] Building an Effective Email Spam Classification Model with spaCy

Kazem Taghandiki|arXiv (Cornell University)|2023. 03. 15.
Spam and Phishing Detection인용 수 4
한 줄 요약

이 논문은 NLP 전처리에 spaCy를 사용하고, 1,500封의 Gmail 이메일 데이터셋을 바탕으로 나이브 베이즈, 의사결정트리 C45, 다층퍼셉트론(MLP)의 세 가지 기계학습 모델을 활용한 스팸 이메일 탐지 시스템을 제안한다. MLP 모델은 96%의 최고 정확도를 기록하여 스팸 이메일와 정상 이메일을 높은 정밀도(97%)와 F1 점수(96%)로 분류하는 데 효과적임을 입증한다.

ABSTRACT

Today, people use email services such as Gmail, Outlook, AOL Mail, etc. to communicate with each other as quickly as possible to send information and official letters. Spam or junk mail is a major challenge to this type of communication, usually sent by botnets with the aim of advertising, harming and stealing information in bulk to different people. Receiving unwanted spam emails on a daily basis fills up the inbox folder. Therefore, spam detection is a fundamental challenge, so far many works have been done to detect spam using clustering and text categorisation methods. In this article, the author has used the spaCy natural language processing library and 3 machine learning (ML) algorithms Naive Bayes (NB), Decision Tree C45 and Multilayer Perceptron (MLP) in the Python programming language to detect spam emails collected from the Gmail service. Observations show the accuracy rate (96%) of the Multilayer Perceptron (MLP) algorithm in spam detection.

연구 동기 및 목표

  • 사용자 보안과 수신함의 무결성을 해칠 수 있는 증가하는 스팸 이메일 문제를 해결하기 위해.
  • 실제 스팸 이메일 탐지에 효과적인 텍스트 분류 파이프라인을 현대적인 NLP 기법을 활용해 구축하기 위해.
  • 실제 이메일 데이터셋에서 나이브 베이즈, 의사결정트리 C45, 다층퍼셉트론의 성능을 평가하고 비교하기 위해.
  • spaCy가 후속 기계학습 작업을 위한 이메일 텍스트 전처리에 얼마나 효과적인지 입증하기 위해.
  • 자동 스팸 필터링을 위한 고정확도, 확장 가능한 솔루션을 제공하기 위해.

제안 방법

  • Gmail에서 1,500개의 이메일 샘플(학습용 1,125개, 테스트용 375개)을 수집하고 스팸 또는 정상 이메일로 레이블링하였다.
  • 텍스트 전처리를 위해 spaCy를 활용하여 토큰화, 표제어 추출, 불용어 제거 및 품사 태깅을 수행하였다.
  • 나이브 베이즈, 의사결정트리 C45, 다층퍼셉트론의 scikit-learn 구현체를 사용해 모델을 훈련시켰다.
  • 이메일 내용에서 추출한 전처리된 텍스트 특징을 바탕으로 bag-of-words 또는 유사한 벡터화 방법을 사용해 모델을 훈련시켰다.
  • 테스트 세트에서 정확도, 정밀도, 재현율, F1 점수 등의 표준 지표를 사용해 모델 성능을 평가하였다.
  • 모델 성능 비교를 위해 혼동 행렬과 성능 시각화를 활용하였다.
Figure 1: Implementation process of the proposed approach
Figure 1: Implementation process of the proposed approach

실험 결과

연구 질문

  • RQ1spaCy 기반 텍스트 전처리가 스팸 이메일 분류에서 기계학습 모델의 성능을 뚜렷이 향상시킬 수 있는가?
  • RQ2실제 Gmail 데이터셋에서 나이브 베이즈, 의사결정트리 C45, 다층퍼셉트론은 스팸 이메일와 정상 이메일을 어떻게 분류하는가?
  • RQ3기존 기계학습 모델을 사용한 스팸 탐지에서 정밀도, 재현율, 정확도 사이의 최적의 균형은 무엇인가?
  • RQ4기계학습 알고리즘의 선택이 악성 또는 속임수성 이메일 콘텐츠 탐지에 얼마나 큰 영향을 미치는가?
  • RQ5이 특정 스팸 분류 작업에서 다층퍼셉트론이 나이브 베이즈나 의사결정트리와 같은 간단한 모델을 능가할 수 있는가?

주요 결과

  • 다층퍼셉트론(MLP) 모델은 스팸 이메일 분류에서 최고의 정확도 96%를 기록하였다.
  • MLP 모델은 정밀도 97%와 F1 점수 96%를 기록하여 가짜 양성 결과를 최소화하고 정밀도와 재현율을 균형 있게 유지하는 데 뛰어난 성능을 보였다.
  • 의사결정트리 C45 모델은 가장 높은 재현율(95%)을 기록하여 다른 모델들보다 실제 스팸 이메일를 더 잘 탐지하는 것으로 나타났다.
  • 나이브 베이즈는 MLP에 비해 낮은 정확도와 F1 점수를 기록하여 이메일 텍스트의 복잡한 패턴을 포착하는 데 한계가 있음을 시사했다.
  • 표제어 추출, 불용어 제거, 토큰화를 포함한 spaCy 전처리의 활용은 모든 알고리즘에서 성능 향상에 뚜렷한 기여를 하였다.
  • 혼동 행렬 분석 결과, MLP는 잘못 분류된 사례 수가 가장 적었으며, 특히 가짜 음성 결과를 줄이는 데 뛰어난 성능을 보였다.
Figure 2: Tokenisation pre-processing
Figure 2: Tokenisation pre-processing

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.