Skip to main content
QUICK REVIEW

[논문 리뷰] A Transformer-based Model to Detect Phishing URLs

Pingfan Xu|arXiv (Cornell University)|2021. 09. 05.
Spam and Phishing Detection참고 문헌 25인용 수 6
한 줄 요약

이 논문은 자가주의 메커니즘을 활용하여 URL 시퀀스를 분석하고 97.3%의 테스트 정확도를 달성하는 경량 Transformer 기반 모델을 제안한다. 이 모델은 모든 평가 지표에서 6종의 고전적 기계학습 모델을 능가하며, 악성 URL 분류에 있어서 주목할 만한 주의 기반 아키텍처의 효과를 입증한다.

ABSTRACT

Phishing attacks are among emerging security issues that recently draws significant attention in the cyber security community. There are numerous existing approaches for phishing URL detection. However, malicious URL detection is still a research hotspot because attackers can bypass newly introduced detection mechanisms by changing their tactics. This paper will introduce a transformer-based malicious URL detection model, which has significant accuracy and outperforms current detection methods. We conduct experiments and compare them with six existing classical detection models. Experiments demonstrate that our transformer-based model is the best performing model from all perspectives among the seven models and achieves 97.3 % of detection accuracy.

연구 동기 및 목표

  • 기존 탐지 기법을 회피하는 진화하는 피싱 공격에 대응하기 위해.
  • 딥러닝을 활용해 실시간 악성 URL 탐지에 적합한 경량이면서도 높은 성능을 갖춘 모델을 개발하기 위해.
  • 정확도, 정밀도, 재현율, F1 점수 측면에서 기존의 고전적 모델과 비교하여 제안된 모델의 성능을 평가하기 위해.
  • 상대적으로 연구가 덜 이루어진 적용 분야인 URL 기반 피싱 탐지에서 Transformer 아키텍처의 실현 가능성을 입증하기 위해.
  • 브라우저 보안 또는 기업 수준의 피싱 방지 시스템에 통합하기 위한 강력하고 확장 가능한 솔루션을 제공하기 위해.

제안 방법

  • 모델은 다중 헤드 자기주의를 통해 장거리 의존성을 포착할 수 있도록, 입력 URL를 토큰화된 시퀀스로 처리하는 Transformer 인코더 아키텍처를 사용한다.
  • 입력 URL는 학습된 어휘를 사용해 서브워드 단위로 토큰화되어, 다양한 URL 패턴을 효과적으로 표현할 수 있도록 한다.
  • 시퀀스 순서를 유지하기 위해 토큰 임베딩에 학습된 위치 임베딩을 추가하며, 이는 URL에서의 가짜 표기 패턴을 탐지하는 데 핵심적이다.
  • PhishTank 및 UNB 피싱 URL 컬렉션을 조합한 데이터셋을 사용하여 교차 엔트로피 손실을 기반으로 엔드 투 엔드로 모델을 훈련시킨다.
  • [CLS] 토큰 표현에 피드포워드 네트워크 헤드를 적용하여 이진 분류 출력(악성/양성)을 생성한다.
  • 과적합을 방지하기 위해 검증 세트에서 조기 정지 기법을 사용하며, Adam 옵timizer와 코즈인 학습률 감소 전략을 사용해 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1고전적 기계학습 모델에 비해 Transformer 기반 아키텍처가 피싱 URL 탐지에서 뛰어난 성능을 낼 수 있는가?
  • RQ2Transformer의 주의 메커니즘이 가짜 표기나 시각적으로 속이는 URL 탐지에 어떻게 기여하는가?
  • RQ3정확도, 정밀도, 재현율, F1 점수와 같은 핵심 지표에서 제안된 모델의 비교 성능는 어떠한가?
  • RQ4학습 데이터에 포함되지 않은 실제 세계의 새로운 피싱 URL에 대해 모델이 잘 일반화되는가?
  • RQ5실시간 배포에 적합한 경량 구조를 유지하면서도 고성능을 유지를 할 수 있는가?

주요 결과

  • 제안된 Transformer 모델은 테스트 정확도 97.3%를 기록했으며, 모든 평가 지표에서 6종의 고전적 모델(결정 트리, 랜덤 포레스트, 다층 퍼셉트론, XGBoost, SVM, 오토에인코더)을 모두 능가했다.
  • 정밀도 98.4%, 재현율 96.2%, F1 점수 97.3%를 기록하여, 임의의 오진과 가짜 음성의 수를 최소화하는 데 뛰어난 균형을 이뤘다.
  • 7종의 모델 중에서 Transformer 모델이 가장 높은 F1 점수를 기록하여 정밀도와 재현율의 균형을 가장 잘 유지하는 최종 성능를 보였다.
  • 혼동 행렬을 통해 진짜 양성과 진짜 음성의 비율이 높았으며, 테스트 세트에서 오진 양성 19건, 오진 음성 21건만 기록되었다.
  • 다음으로 성능이 뛰어난 모델인 랜덤 포레스트 모델에 비해 정확도에서 12.4%p, F1 점수에서 15.0%p 높은 성능를 기록하며 뚜렷한 우월성을 입증했다.
  • 결과적으로 자기주의 메커니즘이 조작된 악성 URL의 구조적 및 문법적 패턴을 효과적으로 포착할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.