Skip to main content
QUICK REVIEW

[논문 리뷰] Detecting Threat E-mails using Bayesian Approach

M. Tariq Banday, Jameel A. Qadri|arXiv (Cornell University)|2011. 12. 23.
Spam and Phishing Detection참고 문헌 9인용 수 6
한 줄 요약

이 논문은 단일 키워드, 가중치가 부여된 다중 키워드, 그리고 맥락 매칭이 포함된 가중치가 부여된 다중 키워드의 세 가지 방법을 사용하여 위협 이메일을 분류하기 위한 나이브 베이지안 접근법을 제안한다. 테러리즘 관련 이메일 코퍼스에서 평가한 결과, 맥락 인식 기반 접근법이 분류 정확도를 크게 향상시켜, 법집행 및 정보기관 응용 분야에서 위협 이메일 필터링 시스템의 성능을 향상시키는 데 맥락 분석의 효과를 입증한다.

ABSTRACT

Fraud and terrorism have a close connect in terms of the processes that enables and promote them. In the era of Internet, its various services that include Web, e-mail, social networks, blogs, instant messaging, chats, etc. are used in terrorism not only for communication but also for i) creation of ideology, ii) resource gathering, iii) recruitment, indoctrination and training, iv) creation of terror network, and v) information gathering. A major challenge for law enforcement and intelligence agencies is efficient and accurate gathering of relevant and growing volume of crime data. This paper reports on use of established Naïve Bayesian filter for classification of threat e-mails. Efficiency in filtering threat e-mail by use of three different Naïve Bayesian filter approaches i.e. single keywords, weighted multiple keywords and weighted multiple keywords with keyword context matching are evaluated on a threat e-mail corpus created by extracting data from sources that are very close to terrorism.

연구 동기 및 목표

  • 반테러 노력에서 대량의 위협 관련 이메일을 필터링하는 데 증가하는 과제를 해결하기 위해.
  • 테러리즘 관련 콘텐츠를 포함한 이메일을 탐지하는 데 있어 나이브 베이지안 분류기의 효과성을 평가하기 위해.
  • 단일 키워드, 가중치가 부여된 다중 키워드, 맥락 인식 키워드 매칭의 세 가지 베이지안 필터링 기법을 비교하기 위해.
  • 테러리즘 관련 소스에서 수집한 실제 위협 데이터를 기반으로 견고한 이메일 분류 시스템을 개발하기 위해.
  • 키워드 기반 필터링에 맥락 정보를 통합하여 정보 기관의 탐지 정확도를 향상시키기 위해.

제안 방법

  • 연구는 테러리즘과 밀접한 관련이 있는 출처에서 수집한 수작업으로 정제된 위협 이메일 코퍼스를 기반으로 훈련된 나이브 베이지안 분류기를 사용한다.
  • 세 가지 필터링 접근법을 구현한다: (1) 단일 키워드 매칭, (2) 가중치가 부여된 다중 키워드, (3) 맥락 매칭이 포함된 가중치가 부여된 다중 키워드.
  • 키워드 가중치는 빈도와 위협 지표와의 관련성에 기반하여 할당되어, 정상 콘텐츠와 악성 콘텐츠 간의 구분 능력을 향상시킨다.
  • 맥락 매칭은 위협 관련 키워드 간의 문법적 및 의미적 근접성을 분석하여 분류 정밀도를 향상시킨다.
  • 모델은 조건부 확률 추정치를 사용하여 특성의 존재 여부에 기반해 이메일이 위협임을 판단할 확률을 계산한다.
  • 성능 평가는 보류된 테스트 세트에서 표준 지표인 정밀도, 재현율, F1 점수를 사용하여 평가된다.

실험 결과

연구 질문

  • RQ1나이브 베이지안 분류기는 테러리즘 관련 코퍼스에서 위협 이메일 탐지에 얼마나 효과적인가?
  • RQ2단일 키워드 필터링에 비해 키워드 가중치를 통합하면 탐지 정확도가 향상되는가?
  • RQ3가중치가 부여된 키워드에 맥락 매칭을 추가하면 분류 성능이 얼마나 향상되는가?
  • RQ4정밀도, 재현율, F1 점수 측면에서 세 가지 필터링 접근법은 어떻게 비교되는가?
  • RQ5맥락 분석을 통해 위협 이메일 탐지에서 임의 경고(false positives)를 줄일 수 있는가?

주요 결과

  • 가중치가 부여된 다중 키워드 접근법은 정밀도와 F1 점수 측면에서 단일 키워드 필터링에 비해 유의미하게 뛰어났다.
  • 가중치가 부여된 키워드 모델에 맥락 매칭을 통합한 결과, 세 가지 방법 중에서 가장 높은 탐지 정확도를 기록했다.
  • 맥락 인식 모델은 위협 관련 용어의 정상적 사용과 악성 사용을 효과적으로 구분함으로써 임의 경고를 줄였다.
  • 연구는 키워드 가중치와 맥락 분석을 조합함으로써 자동화된 위협 이메일 탐지 시스템의 신뢰성을 향상시킬 수 있음을 입증했다.
  • 도메인 특화된, 테러리즘과 밀접한 관련이 있는 데이터를 기반으로 훈련된 나이브 베이지안 프레임워크는 위협 이메일 분류에 효과적이었다.
  • 결과는 맥락적 특징을 갖춘 베이지안 필터링을 정보 기관 및 법집행 기관의 이메일 모니터링에 실용적인 솔루션으로 활용할 수 있음을 지지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.