Skip to main content
QUICK REVIEW

[논문 리뷰] Reliability and Robustness analysis of Machine Learning based Phishing URL Detectors

Bushra Sabir, M. Ali Babar|arXiv (Cornell University)|2020. 05. 18.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 최신 기계학습 기반 피싱 URL(MLPU) 검출기의 신뢰성과 내구성 평가를 위한 종합적인 방법론을 제안한다. URLBUG라는 비용 효율적인 대안적 URL 생성기를 도입하여 문법적으로 유효하고 등록 가능한 URL을 생성하며, 연간 평균 등록 비용은 11.99달러이며, 이 중 63.94%는 악성 목적으로 사용된다. 연구 결과, 높은 성능을 보이는 MLPU 모델들(중위 MCC 0.92)이 대안적 입력을 받을 경우 극적으로 성능이 떨어지며(중위 MCC가 0.02로 하락), 현재 시스템에 심각한 보안 취약점이 존재하는 것으로 드러났다.

ABSTRACT

ML-based Phishing URL (MLPU) detectors serve as the first level of defence to protect users and organisations from being victims of phishing attacks. Lately, few studies have launched successful adversarial attacks against specific MLPU detectors raising questions about their practical reliability and usage. Nevertheless, the robustness of these systems has not been extensively investigated. Therefore, the security vulnerabilities of these systems, in general, remain primarily unknown which calls for testing the robustness of these systems. In this article, we have proposed a methodology to investigate the reliability and robustness of 50 representative state-of-the-art MLPU models. Firstly, we have proposed a cost-effective Adversarial URL generator URLBUG that created an Adversarial URL dataset. Subsequently, we reproduced 50 MLPU (traditional ML and Deep learning) systems and recorded their baseline performance. Lastly, we tested the considered MLPU systems on Adversarial Dataset and analyzed their robustness and reliability using box plots and heat maps. Our results showed that the generated adversarial URLs have valid syntax and can be registered at a median annual price of \$11.99. Out of 13\% of the already registered adversarial URLs, 63.94\% were used for malicious purposes. Moreover, the considered MLPU models Matthew Correlation Coefficient (MCC) dropped from a median 0.92 to 0.02 when tested against $Adv_\mathrm{data}$, indicating that the baseline MLPU models are unreliable in their current form. Further, our findings identified several security vulnerabilities of these systems and provided future directions for researchers to design dependable and secure MLPU systems.

연구 동기 및 목표

  • 기존의 최신 MLPU 검출기가 대안적 입력에 대해 내구성과 신뢰성 있는지 조사하기 위해.
  • 실제 피싱 공격에서 악용될 수 있는 기존 MLPU 모델의 보안 취약점을 특정하기 위해.
  • 모델의 내구성을 테스트하기 위한 실용적이고 비용 효율적인 실재성 있는 대안적 URL 생성 방법을 개발하기 위해.
  • 더 안정적이고 신뢰할 수 있는 MLPU 시스템 설계를 위한 실질적인 통찰을 제공하기 위해.

제안 방법

  • 문법적으로 유효하고 등록 가능한 URL을 생성하기 위해 단어 수준 및 문자 수준의 변형을 적용하는 타겟된 대안적 URL 생성기인 URLBUG를 제안하였다.
  • 보고된 아키텍처와 특징 집합을 사용하여 기존의 기계학습 및 딥러닝 모델을 포함한 50개의 대표적 MLPU 모델을 재현하였다.
  • TLD 교체, 동음이이성자, 문자 수준의 대체와 같은 특정 변형을 적용하여 대안적 URL 데이터셋($Adv_{\mathrm{data}}$)을 구축하였다.
  • Matthew 상관관계 계수(MCC), 정확도, F1 점수와 같은 표준 지표를 사용하여 $Adv_{\mathrm{data}}$에서의 모델 성능을 평가하였다.
  • 상자 그림과 히트맵을 활용해 다양한 모델, 특징, 변형 유형 간의 내구성 차이를 비교 분석하였다.
  • 대체적 공격에 대한 내구성이 높은 특징 유형과 분류기 유형을 특정하기 위해 분해 분석(ablation studies)를 수행하였다.

실험 결과

연구 질문

  • RQ1실제로 등록 가능한 변형을 적용한 현실적인 방법으로 생성된 대안적 URL을 탐지하는 데 있어 기존 MLPU 모델의 효과는 어떠한가?
  • RQ2생성된 대안적 URL의 실제 등록 비용과 피싱 캠페인에서의 실제 사용 가능성 측면에서 실질적인 적용 가능성과 악성 활용 가능성은 어떠한가?
  • RQ3피싱 URL 탐지 작업에서 대안적 변형에 대해 가장 내구성이 높은 모델 아키텍처와 특징 표현 방식은 무엇인가?
  • RQ4현재 MLPU 검출기에서 대안적 조건에서 높은 실패율을 초래하는 주요 보안 취약점은 무엇인가?
  • RQ5컴퓨터 비전 및 자연어 처리 분야에서 사용되는 내구성 지표를 블랙박스 평가를 위해 피싱 탐지 분야에 적응시킬 수 있는가?

주요 결과

  • URLBUG가 생성한 대안적 URL은 문법적으로 유효하며, 연간 평균 등록 비용이 11.99달러로 실질적인 적용 가능성을 보여준다.
  • 이미 등록된 13%의 대안적 URL 중 63.94%는 악성 목적으로 실제로 사용되고 있어 실제 위협 잠재력이 확인되었다.
  • 50개의 MLPU 모델이 대안적 데이터셋에서 테스트되었을 때 중위 Matthew 상관관계 계수(MCC)가 0.92에서 0.02로 급격히 하락하여 심각한 성능 저하가 발생함을 확인하였다.
  • 기본적인 어휘적 및 외부 특징(예: URL 길이, TLD, 의심스러운 키워드 유무 등)은 대안적 테스트에서 30% 미만의 오분류를 보이며 높은 내구성을 보였다.
  • LSTM 기반 분류기는 경로 수준의 대안적 변형에 대해 거의 완벽한 탐지 성능(99.99% 정확도)을 보였으며, 이는 구조적 변화에 매우 민감한 것으로 나타났다.
  • 문자 수준의 변형이 가장 높은 실패율을 유발하였으며, 90%의 모델이 이러한 대안적 URL을 잘못 분류하여 현재 모델에 심각한 취약점이 있음을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.