Skip to main content
QUICK REVIEW

[논문 리뷰] Phishing Detection Using Machine Learning Techniques

Vahid Shahrivari, Mohammad Mahdi Darabi|arXiv (Cornell University)|2020. 09. 20.
Spam and Phishing Detection인용 수 15
한 줄 요약

이 논문은 11,055개의 웹사이트(6,157개의 정상, 4,898개의 피싱)로 구성된 데이터셋을 사용하여 9개의 기계학습 모델—로지스틱 회귀, 의사결정트리, 랜덤 포레스트, AdaBoost, 서포트 벡터 머신, K-최근접 이웃, 신경망, 그래디언트 부스팅, XGBoost—에 대한 피싱 웹사이트 탐지 성능을 평가한다. XGBoost는 정규화, 학습률, 특성 부분집합 추출 덕분에 가장 높은 F1 점수와 빠른 학습 속도를 기록하여 다른 모델들보다 뛰어나며, 특히 소규모 데이터셋에서 일반화 능력이 뛰어나 신경망보다도 뛰어나다. 다만 학습 시간이 길고 해석 가능성은 떨어진다.

ABSTRACT

The Internet has become an indispensable part of our life, However, It also has provided opportunities to anonymously perform malicious activities like Phishing. Phishers try to deceive their victims by social engineering or creating mock-up websites to steal information such as account ID, username, password from individuals and organizations. Although many methods have been proposed to detect phishing websites, Phishers have evolved their methods to escape from these detection methods. One of the most successful methods for detecting these malicious activities is Machine Learning. This is because most Phishing attacks have some common characteristics which can be identified by machine learning methods. In this paper, we compared the results of multiple machine learning methods for predicting phishing websites.

연구 동기 및 목표

  • 다양한 기계학습 알고리즘의 피싱 웹사이트 탐지 성능을 평가하고 비교하는 것.
  • 정확도, 학습 속도, 일반화 능력 기반으로 피싱 탐지에 가장 효과적인 모델을 특정하는 것.
  • 초기화수치 조정과 모델 아키텍처가 탐지 성능에 미치는 영향을 분석하는 것.
  • 해석 가능성, 계산 비용, 탐지 효과성 간의 상충 관계를 탐색하는 것.
  • 향후 연구를 위해 공개된 데이터셋과 코드를 기반으로 재현 가능한 벤치마크를 제공하는 것.

제안 방법

  • 연구는 로지스틱 회귀, 의사결정트리, 랜덤 포레스트, AdaBoost, 서포트 벡터 머신, K-최근접 이웃, 신경망, 그래디언트 부스팅, XGBoost를 포함한 9개의 다양한 지도 학습 분류기들을 활용한다.
  • 특성은 웹사이트 URL과 콘텐츠에서 추출되며, URL 길이, 'https'의 존재, 'www' 사용 여부, 특수문자 포함 여부 등을 포함한다.
  • XGBoost는 과적합을 줄이고 일반화 능력을 향상시키기 위해 학습률, 특성 및 샘플 부분집합 추출, L2 정규화를 적용한다.
  • 신경망은 Adam 옵timizer와 ReLU 활성화 함수를 사용하여 훈련되며, 500 에포크 후 조기 정지 기능을 적용하고, 다양한 은닉층 깊이를 시험한다.
  • K-최근접 이웃의 성능은 다양한 K 값에 대해 평가되어 편향-분산 균형을 분석한다.
  • 모델 평가는 정확도, F1 점수, 정밀도, 재현율, 학습 시간 등의 표준 지표를 기반으로 하며, 결과는 비교 표와 그림으로 보고된다.

실험 결과

연구 질문

  • RQ1어느 기계학습 모델이 피싱 웹사이트 분류에서 가장 높은 F1 점수와 정확도를 기록하는가?
  • RQ2특히 중간 크기의 데이터셋에서 다양한 모델 간의 학습 속도와 계산 효율성은 어떻게 비교되는가?
  • RQ3초기화수치 조정과 정규화가 모델의 일반화 능력과 강건성에 어떤 영향을 미치는가?
  • RQ4특히 XGBoost와 신경망 간의 모델 해석 가능성은 어떻게 비교되는가?
  • RQ5랜덤 포레스트와 같은 앙상블 방법은 피싱 탐지에서 개별 모델을 지속적으로 능가하는가?

주요 결과

  • XGBoost는 모든 모델 중에서 가장 높은 F1 점수를 기록하여 피싱 탐지 작업에서 뛰어난 성능을 보였다.
  • XGBoost는 학습 속도가 가장 빠르며, 신경망과 서포트 벡터 머신에 비해 계산 효율성이 뛰어나다.
  • 신경망은 모든 다른 모델보다 훨씬 더 많은 학습 시간을 소요했고, 깊은 아키텍처를 가졌음에도 불구하고 F1 점수에서 XGBoost를 능가하지 못했다.
  • 랜덤 포레스트와 XGBoost는 모두 높은 정확도와 빠른 추론 성능를 보여, 실시간 구현에 강력한 후보가 된다.
  • K-최근접 이웃는 작은 수의 이웃에서 우수한 성능를 보이며 낮은 편향을 보였지만 높은 분산을 보였고, 더 큰 K 값은 더 매끄럽지만 덜 민감한 결정 경계를 만들었다.
  • XGBoost는 정규화, 학습률, 특성 부분집합 추출의 조합 덕분에 특히 소규모 데이터셋에서 신경망보다 더 뛰어난 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.