Skip to main content
QUICK REVIEW

[논문 리뷰] A Deep Learning Model with Hierarchical LSTMs and Supervised Attention for Anti-Phishing

Le-Minh Nguyen, Toan Nguyen|arXiv (Cornell University)|2018. 05. 03.
Spam and Phishing Detection참고 문헌 22인용 수 21
한 줄 요약

이 논문은 단어 수준 및 문장 수준의 표현을 활용하여 분류 성능을 향상시키기 위해 지도 학습 기반의 어텐션을 갖춘 계층적 LSTM 모델을 제안한다. 이 모델은 상태 기반 성능을 달성하여, 헤더가 없는 경우 F1 점수 0.979, 헤더가 있는 경우 F1 점수 0.991로 IWSPA-AP 2018 공동 과제에서 미리 보지 않은 테스트 데이터에서 1위를 기록하였다.

ABSTRACT

Anti-phishing aims to detect phishing content/documents in a pool of textual data. This is an important problem in cybersecurity that can help to guard users from fraudulent information. Natural language processing (NLP) offers a natural solution for this problem as it is capable of analyzing the textual content to perform intelligent recognition. In this work, we investigate state-of-the-art techniques for text categorization in NLP to address the problem of anti-phishing for emails (i.e, predicting if an email is phishing or not). These techniques are based on deep learning models that have attracted much attention from the community recently. In particular, we present a framework with hierarchical long short-term memory networks (H-LSTMs) and attention mechanisms to model the emails simultaneously at the word and the sentence level. Our expectation is to produce an effective model for anti-phishing and demonstrate the effectiveness of deep learning for problems in cybersecurity.

연구 동기 및 목표

  • 수동적인 특징 공학에 의존하는 전통적인 피싱 탐지 방법의 한계를 해결하기 위해.
  • 원시 이메일 텍스트로부터 효과적인 표현을 자동으로 학습할 수 있는 엔드 투 엔드 딥 러닝 모델을 개발하기 위해.
  • 단어 수준과 문장 수준에서 이메일의 구조를 계층적으로 모델링하여 피싱 탐지 성능을 향상시키기 위해.
  • 단어 빈도 순위 기반의 새로운 지도 학습 기반 어텐션 메커니즘을 통해 모델의 해석 가능성과 성능을 향상시키기 위해.
  • IWSPA-AP 2018 공동 과제의 실제 세계에서의 불균형 피싱 이메일 데이터셋을 기반으로 모델을 평가하기 위해.

제안 방법

  • 모델는 단어 수준의 LSTM이 문장 내 개별 단어를 처리하고, 문장 수준의 LSTM이 문장 표현을 종합하여 전체 이메일 표현을 생성하는 계층적 LSTM 아키텍처를 사용한다.
  • 어텐션 메커니즘이 단어 수준과 문장 수준 모두에 적용되어 이메일 내 다양한 단어와 문장의 중요도를 동적으로 가중치를 부여한다.
  • 새로운 지도 학습 기반 어텐션 기법이 도입되었으며, 이는 훈련 데이터 어휘 내 단어의 역빈도 순위를 기반으로 단어 수준 어텐션을 유도하여 희귀하고 잠재적으로 위험한 용어를 우선순위로 지정한다.
  • 헤더 기능을 모델링하기 위해 별도의 헤더 네트워크와 함께 어텐션 기반 LSTM이 통합되어 있어, 헤더가 제공될 경우 탐지 정확도가 향상된다.
  • 모델는 교차 엔트로피 손실을 사용하여 백프로파게이션 스트림을 통해 최적화되는 엔드 투 엔드 방식으로 훈련된다.
  • 헤더가 포함된 데이터의 경우, 전체 헤더 데이터셋에서 추출된 본문 텍스트와 결합하여 더 넓고 견고한 훈련 분포를 생성한다.

실험 결과

연구 질문

  • RQ1어텐션 메커니즘을 갖춘 계층적 딥 러닝 모델이 전통적인 머신 러닝 방법보다 피싱 이메일 탐지에서 뛰어난 성능을 내는가?
  • RQ2전용 헤더 네트워크를 사용해 이메일 헤더를 분류 파이프라인에 통합하는 것이 얼마나 효과적인가?
  • RQ3단어 빈도 순위 기반의 지도 학습 기반 어텐션은 모델 성능과 해석 가능성에 얼마나 기여하는가?
  • RQ4단어 수준과 문장 수준에서 이메일을 계층적으로 모델링하는 방식이 평탄한 모델에 비해 더 나은 표현 학습을 이끌어내는가?
  • RQ5균형 잡힌 공개 벤치마크와 비교하여, 모델은 실제 세계의 불균형 피싱 데이터셋에 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 H-LSTM와 지도 학습 기반 어텐션은 첫 번째 공동 과제(헤더 없음)에서 F1 점수 0.979를 기록하여 참가 시스템 중 1위를 차지하였다.
  • 두 번째 공동 과제(헤더 있음)에서는 F1 점수 0.991을 기록하여 전체적으로 2위를 기록하였으며, 실제 세계 데이터에서 뛰어난 성능을 입증하였다.
  • 헤더 네트워크의 통합으로 교차 검증에서 F1 점수는 0.9631에서 0.9705로 향상되어 성능이 약 0.7% 상승하였다.
  • 데이터-no-header 및 data-full-header 세트에서 유래한 데이터를 결합하여 훈련한 모델은 개별 데이터로 훈련한 모델보다 성능이 뛰어나 일반화 능력 향상이 확인되었다.
  • 단어 빈도 순위 기반의 지도 학습 기반 어텐션 메커니즘이 희귀하고 잠재적으로 악성인 단어에 대한 모델 집중도를 크게 향상시켜 탐지 성능 향상에 기여하였다.
  • 전체 모델(H-LSTM + 헤더 + 지도 학습 기반 어텐션)의 훈련 시간은 1.5시간이었으며, 테스트 데이터에 대한 추론 시간은 단 1분으로 실용적인 구현 가능성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.