Skip to main content
QUICK REVIEW

[논문 리뷰] An Explainable Transformer-based Model for Phishing Email Detection: A Large Language Model Approach

Mohammad Amaz Uddin, Iqbal H. Sarker|arXiv (Cornell University)|2024. 02. 21.
Spam and Phishing Detection인용 수 4
한 줄 요약

이 논문은 막힘 언어 모델의 문맥적 임bedding을 활용하고 클래스 불균형을 완화함으로써 설명 가능한 인공지능(XAI) 기법—LIME 및 Transformer Interpret를 통합한 최적화된 DistilBERT 모델을 제안한다. 이 모델은 균형 잡힌 데이터셋에서 테스트 정확도 98.48%를 달성하며, XAI 기법을 통해 분류 결정을 인간이 이해할 수 있는 투명한 설명으로 제공한다.

ABSTRACT

Phishing email is a serious cyber threat that tries to deceive users by sending false emails with the intention of stealing confidential information or causing financial harm. Attackers, often posing as trustworthy entities, exploit technological advancements and sophistication to make detection and prevention of phishing more challenging. Despite extensive academic research, phishing detection remains an ongoing and formidable challenge in the cybersecurity landscape. Large Language Models (LLMs) and Masked Language Models (MLMs) possess immense potential to offer innovative solutions to address long-standing challenges. In this research paper, we present an optimized, fine-tuned transformer-based DistilBERT model designed for the detection of phishing emails. In the detection process, we work with a phishing email dataset and utilize the preprocessing techniques to clean and solve the imbalance class issues. Through our experiments, we found that our model effectively achieves high accuracy, demonstrating its capability to perform well. Finally, we demonstrate our fine-tuned model using Explainable-AI (XAI) techniques such as Local Interpretable Model-Agnostic Explanations (LIME) and Transformer Interpret to explain how our model makes predictions in the context of text classification for phishing emails.

연구 동기 및 목표

  • 기존 탐지 방법을 회피하는 고도로 발전한 피싱 공격의 증가하는 도전 과제를 해결하기 위해.
  • 최신 트랜스포머 기반 대규모 언어 모델(LLM)를 활용해 피싱 이메일 탐지 정확도를 향상시키기 위해.
  • 사전 처리 및 재표본화 기법을 통해 피싱 이메일 데이터셋의 클래스 불균형을 완화하기 위해.
  • 해석 가능성 향상을 위해 설명 가능한 인공지능(XAI) 기법을 통합하여 신뢰성과 투명성을 확보하기 위해.
  • 최적화된 DistilBERT와 XAI 기법을 활용해 고성능 피싱 탐지가 정확성과 해석 가능성 모두에서 가능함을 입증하기 위해.

제안 방법

  • 피싱 이메일 대비 정상 이메일의 이진 텍스트 분류를 위해 최적화된 DistilBERT(비트리미드된 BERT의 변형)를 사용한다.
  • 텍스트 정제, 토큰화 및 오버샘플링 또는 언더샘플링를 통한 클래스 불균형 처리를 포함한 데이터 사전 처리 기법을 적용한다.
  • 배치 크기, 학습률 및 옵티마이저(예: AdamW) 등의 하이퍼파라미터를 최적화하여 모델 수렴 및 성능을 향상시킨다.
  • 최적화 과정에서 막힘 언어 모델(MLM) 목표를 활용하여 단어 및 서브워드의 문맥적 이해를 유지한다.
  • LIME 및 Transformer Interpret를 활용해 개별 단어 또는 서브워드에 대한 예측 신뢰도 기여도를 할당함으로써 국소적이고 인스턴스 수준의 설명을 생성한다.
  • 불균형 및 균형 잡힌 데이터셋 모두에서 정확도, 정밀도, 재현율 및 F1 점수와 같은 표준 NLP 지표를 사용해 모델 성능을 평가한다.
Figure 1 : The proposed overall methodology.
Figure 1 : The proposed overall methodology.

실험 결과

연구 질문

  • RQ1기존 접근 방식과 비교해 볼 때, 최적화된 DistilBERT 모델은 피싱 이메일 탐지에 얼마나 효과적인가?
  • RQ2클래스 불균형은 트랜스포머 기반 모델의 피싱 탐지 성능에 어느 정도 영향을 미치는가?
  • RQ3LIME 및 Transformer Interpret는 모델 예측에 대해 실질적이고 인간이 이해할 수 있는 설명을 어떻게 제공하는가?
  • RQ4해석 가능성 기법은 사이버보안 응용 분야에서 사용자 신뢰 및 모델 투명성을 향상시키는 데 기여하는가?
  • RQ5피싱 이메일 분류에서 LIME와 Transformer Interpret 간 설명의 정밀도 및 단어 기여도에 어떤 차이가 있는가?

주요 결과

  • 불균형 데이터셋에서 최적화된 DistilBERT 모델은 학습 정확도 98.90%와 테스트 정확도 97.50%를 기록하여 클래스 편향에도 불구하고 강력한 일반화 능력을 입증했다.
  • 균형 잡힌 데이터셋에서 모델은 학습 정확도 99.07%와 테스트 정확도 98.48%를 달성하여 균형 잡힌 데이터에서 성능 향상이 확인되었다.
  • 불균형 데이터에서도 모델 성능은 뚜렷하게 유지되었으며, 테스트 정확도가 1%p 뿐 감소하여 클래스 불균형을 효과적으로 처리함을 시사한다.
  • LIME 및 Transformer Interpret는 단어 및 서브워드에 양성 또는 음성 기여도 점수를 할당하여 상호보완적인 설명을 제공했으며, 핵심 예측 특징을 부각시켰다.
  • 높은 양성 기여도 점수를 가진 단어는 일반적으로 급박한 어조나 의심스러운 URL와 같은 피싱 콘텐츠와 일관되게 연결되었고, 음성 점수는 안전한 용어와 관련이 있었다.
  • 설명 기법은 모델 결정이 의미적으로 유의미한 언어 패턴에 기반하고 있음을 드러내어 예측에 대한 해석 가능성과 신뢰도를 향상시켰다.
Figure 2 : The sample data overview
Figure 2 : The sample data overview

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.