Skip to main content
QUICK REVIEW

[논문 리뷰] DeepBF: Malicious URL detection using Learned Bloom Filter and Evolutionary Deep Learning

Ripon Patgiri, Anupam Biswas|arXiv (Cornell University)|2021. 03. 18.
Caching and Content Delivery인용 수 5
한 줄 요약

이 논문은 자기조정형 2차원 블룸 필터와 진화적 합성곱 신경망(evoCNN)을 조합한 두 단계 악성 URL 탐지 시스템인 deepBF를 제안한다. 2D 블룸 필터에서 수정된 Murmur2 해시 함수를 사용하여 거짓 양성(false positive)을 감소시키고 필터링 속도를 향상시키며, evoCNN은 이전에 본 적 없는 URL을 분류한다. 이 시스템은 일반적인 URL을 빠른 필터 레이어로 이관함으로써 계산 부담을 줄이고 높은 정확도를 달성한다.

ABSTRACT

Malicious URL detection is an emerging research area due to continuous modernization of various systems, for instance, Edge Computing. In this article, we present a novel malicious URL detection technique, called deepBF (deep learning and Bloom Filter). deepBF is presented in two-fold. Firstly, we propose a learned Bloom Filter using 2-dimensional Bloom Filter. We experimentally decide the best non-cryptography string hash function. Then, we derive a modified non-cryptography string hash function from the selected hash function for deepBF by introducing biases in the hashing method and compared among the string hash functions. The modified string hash function is compared to other variants of diverse non-cryptography string hash functions. It is also compared with various filters, particularly, counting Bloom Filter, Kirsch extit{et al.}, and Cuckoo Filter using various use cases. The use cases unearth weakness and strength of the filters. Secondly, we propose a malicious URL detection mechanism using deepBF. We apply the evolutionary convolutional neural network to identify the malicious URLs. The evolutionary convolutional neural network is trained and tested with malicious URL datasets. The output is tested in deepBF for accuracy. We have achieved many conclusions from our experimental evaluation and results and are able to reach various conclusive decisions which are presented in the article.

연구 동기 및 목표

  • 에지 컴퓨팅 및 IoT와 같은 현대 시스템에서 악성 URL 탐지 문제의 증가를 해결하기 위해.
  • 최적화된 블룸 필터를 사용해 알려진 URL을 사전에 걸러내어 딥러닝 모델의 계산 부담을 줄이기 위해.
  • 자기조정형 2차원 구조와 편향 강화된 비암호화 해시 함수를 통해 블룸 필터의 정확도와 효율성을 향상시키기 위해.
  • 기존의 필터(예: Cuckoo, 카운팅 블룸, Kirsch 등)와의 성능을 평가하여, 거짓 양성 비율과 메모리 효율성 측면에서 deepBF의 열등성을 입증하기 위해.
  • 실제 악성 URL 데이터셋을 사용해 종단 간 시스템을 검증하고, 하이브리드 접근 방식이 모델 추론 부담을 최소화하면서도 높은 탐지 정확도를 유지하는지 입증하기 위해.

제안 방법

  • 충돌을 줄이고 해시 분포를 향상시키기 위해 소수로 구성된 치수(m ≠ n)를 사용한 2차원 블룸 필터를 설계한다.
  • MMurmur 및 SHA512와 같은 대안들과의 실험적 비교를 통해, 최적의 비암호화 문자열 해시 함수로 수정된 Murmur2 해시 함수를 선정한다.
  • 암호화 강도를 떨어뜨리지 않으면서도 거짓 양성 비율(FPP)을 증가시키지 않는 조건에서, 해시 함수에 의 intensional 편향과 중복성을 도입하여 성능을 향상시킨다. 이는 실험적으로 검증되었다.
  • 이중 레이어 필터링 메커니즘을 구현한다: 먼저 악성(URL)에 대한 (μBF) 및 양성(URL)에 대한 (βBF) 2D 블룸 필터를 조회한다. 둘 다 거짓을 반환하면, URL을 evoCNN으로 전달하여 분류한다.
  • 공개된 악성 URL 데이터셋(Mamun 데이터셋)을 기반으로 evoCNN을 훈련하고 테스트하여 새로운 URL을 분류한다.
  • evoCNN의 출력을 시스템에 통합한다: 확인된 악성 URL은 μBF에 삽입하고, 양성 URL은 βBF에 삽입함으로써, 시스템이 시간이 지남에 따라 학습하고 적응할 수 있도록 한다.
Figure 1: Mapping of $\mathcal{K}_{1}$ , $\mathcal{K}_{2}$ and $\mathcal{K}_{3}$ into Bloom Filter using $k=3$ hash functions and these hash functions are $\mathcal{H}_{1}()$ , $\mathcal{H}_{2}()$ , $\mathcal{H}_{3}()$ .
Figure 1: Mapping of $\mathcal{K}_{1}$ , $\mathcal{K}_{2}$ and $\mathcal{K}_{3}$ into Bloom Filter using $k=3$ hash functions and these hash functions are $\mathcal{H}_{1}()$ , $\mathcal{H}_{2}()$ , $\mathcal{H}_{3}()$ .

실험 결과

연구 질문

  • RQ1수정된 비암호화 해시 함수를 사용한 자기조정형 2차원 블룸 필터가 기존 및 고급 블룸 필터 변종보다 거짓 양성 비율과 메모리 효율성 측면에서 뛰어난가?
  • RQ2해시 함수에 의도적인 편향과 중복성을 도입하면, 암호화 강도가 감소함에도 불구하고 블룸 필터의 거짓 양성 비율이 악화되는가?
  • RQ3이중 레이어 필터링 아키텍처(Bloom 필터 + evoCNN)는 깊이 있는 학습 모델의 부담을 줄이면서도 높은 탐지 정확도를 유지하는가?
  • RQ4Cuckoo 필터, 카운팅 블룸 필터, Kirsch 등 기존의 필터와의 비교에서, deepBF는 다양한 실제 시나리오에서 어떤 성능을 보이는가?
  • RQ5반복적인 삽입을 통해 블룸 필터가 학습된 행동이 장기적으로 탐지 정확도를 향상시키는 데 얼마나 기여하는가? 이는 evoCNN의 재학습 없이도 가능할까?

주요 결과

  • 수정된 Murmur2 해시 함수는 더 높은 편향과 중복성에도 불구하고, FPP와 속도 측면에서 MMurmur 및 SHA512와 같은 다른 비암호화 해시 함수보다 뛰어났다.
  • 암호화 기반 해시 함수인 SHA512는 높은 계산 비용에도 불구하고 FPP에 유의미한 향상이 없어, 블룸 필터에 필요로 하지 않으며, 일반적인 가정과는 정반대였다.
  • deepBF는 Cuckoo 필터(CF)보다 낮은 거짓 양성 비율을 달성했으며, 특히 큰 키 크기나 반복 실행 시 예측 불가능한 FPP와 메모리 팽창 현상이 발생하는 CF와 비교해 유리했다.
  • 메모리 제약 조건이 동일할 경우, 삭제 기능을 지원하는 카운팅 블룸 필터(CBF)는 전통적인 블룸 필터보다 더 높은 메모리 사용량과 악화된 FPP를 보였다.
  • 이중 레이어 아키텍처는 evoCNN의 부담을 크게 줄였다: 오직 새로운, 본 적 없는 URL만 딥러닝 모델로 전달되었고, 이는 시스템의 효율성을 향상시켰다.
  • deepBF는 CF와 달리 여러 실행에서 안정적인 성능을 보였으며, 나쁜 해시 시드와 설계 결함로 인해 반복 실행 중 불안정한 동작이나 충돌이 발생할 수 있는 CF와 대비되었다.
Figure 2: Architecture self-adjusting Bloom Filter of deepBF depicting with five hash functions. The five hash functions are invoked for 10M items.
Figure 2: Architecture self-adjusting Bloom Filter of deepBF depicting with five hash functions. The five hash functions are invoked for 10M items.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.