Skip to main content
QUICK REVIEW

[논문 리뷰] Improving spam filtering by combining Naive Bayes with simple k-nearest neighbor searches

Daniel Etzold|ArXiv.org|2003. 11. 30.
Spam and Phishing Detection참고 문헌 4인용 수 3
한 줄 요약

이 논문은 유사도 측정으로 유클리드 거리 또는 코사인 각도 유사도를 사용하는 k-가까운 이웃(kNN) 검색과 결합된 나이브 베이즈를 조합한 하이브리드 스팸 필터링 방법을 제안한다. 두 모델의 확률적 점수를 동일한 가중치로 융합함으로써 분류 정확도를 향상시키며, 특히 정상 이메일에 대해 유의미하게 향상되고 특성 차원을 2000에서 500으로 감소시킨다. k=1 및 V=2000 조건에서 정상 이메일의 정확도가 최대 99.25%에 도달한다.

ABSTRACT

Using naive Bayes for email classification has become very popular within the last few months. They are quite easy to implement and very efficient. In this paper we want to present empirical results of email classification using a combination of naive Bayes and k-nearest neighbor searches. Using this technique we show that the accuracy of a Bayes filter can be improved slightly for a high number of features and significantly for a small number of features.

연구 동기 및 목표

  • 표준 나이브 베이즈를 초월해 스팸 필터링 정확도를 향상시키기 위해 k-가까운 이웃 분류를 통합한다.
  • 높은 정확도를 확보하기 위해 필요한 특성 수를 줄여 계산 비용을 낮춘다.
  • 가짜 음성 결과보다 더 비용이 많이 드는 정상 이메일 분류에서의 가짜 양성 결과를 최소화한다.
  • 유클리드 거리 및 코사인 각도를 유사도 측정 수단으로 사용하여 나이브 베이즈와 kNN을 융합하는 효과를 평가한다.

제안 방법

  • 가중치 평균 점수 δ = (αPrnb + βPrknn)/(α + β) 를 사용하여 나이브 베이즈 확률과 kNN 확률을 융합하며, α = β = 1이다.
  • kNN의 유사도 측정으로 문서 벡터 간 유클리드 거리와 코사인 각도를 사용한다.
  • 특성 차원을 500, 1000, 1500, 2000으로 감소시키기 위해 정보 이득을 적용한다.
  • 이메일을 소문자로 변환하고 HTML 태그를 제거하며, 2자 이상의 문자를 포함한 단어와 숫자를 추출하고, 각 HTML 태그마다 'html'을 추가한다.
  • δ 점수 기반으로 이메일을 분류한다: δG ≥ 0.5 이면 '정상', 그 외는 '스팸'으로 간주한다.
  • k ∈ {1, 2, 3, 4, 5} 로 설정한 kNN을 사용하고, 여러 개의 훈련/테스트 분할(25:75, 30:70, 40:60)에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1나이브 베이즈와 kNN을 융합하면 나이브 베이즈 단독 사용 대비 스팸 필터링 정확도가 향상되는가?
  • RQ2하이브리드 접근 방식을 통해 정확도를 유지하면서 특성 차원을 크게 줄일 수 있는가?
  • RQ3유클리드 거리와 코사인 각도 중 어느 유사도 측정 방식이 더 높은 분류 성능을 낳는가?
  • RQ4하이브리드 모델에서 kNN의 최적의 k 값은 무엇이며, 스팸 및 정상 이메일 분류에서 어떻게 달라지는가?
  • RQ5하이브리드 모델은 정상 이메일 분류에서 가짜 양성 결과를 크게 줄일 수 있는가?

주요 결과

  • V=2000 및 k=1 조건에서 코사인 각도 유사도를 사용할 경우 하이브리드 모델은 정상 이메일 분류 정확도가 99.25%에 도달하여 나이브 베이즈 단독 사용을 뛰어넘는다.
  • V=500 특성일 경우 k=1로 정상 이메일 분류 정확도가 99.10%에 도달하며, 이는 V=2000 특성으로 나이브 베이즈를 사용했을 때의 98.65% 정확도를 초월한다.
  • 가짜 양성 결과의 수가 극적으로 감소하며, 특히 k=1일 경우 더욱 두드러진다. 이는 가짜 양성 결과 최소화에 매우 효과적인 접근이다.
  • 스팸 분류의 경우 저차원 특성(V=500)에서 k=2일 때 정확도가 가장 높으며, V=2000 특성으로 나이브 베이즈를 사용한 것보다 뛰어나다.
  • 코사인 각도 유사도 측정 방식은 유클리드 거리와 유사하게 높은 정확도와 특성 차원에 관계없이 뛰어난 안정성을 보이며, 둘 다 높은 성능을 낳는다.
  • 단지 500개의 특성만 사용하고 k=1 또는 k=2로 설정할 경우, 2000개의 특성으로 나이브 베이즈를 사용한 것보다 더 높은 정확도를 달성하며, 이는 계산 비용을 크게 줄이고 성능을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.