Skip to main content
QUICK REVIEW

[논문 리뷰] Automated email Generation for Targeted Attacks using Natural Language

Avisha Das, Rakesh Verma|arXiv (Cornell University)|2019. 08. 19.
Spam and Phishing Detection참고 문헌 19인용 수 14
한 줄 요약

이 논문은 통계적 이메일 검출기들을 회피하기 위해 합법적인 글쓰기 스타일을 모방하는 표적성 악성 이메일을 자동으로 생성하기 위해 순환 신경망(RNNs) 기반 시스템을 제안한다. 이 시스템은 합법적이고 피싱 성격이 있는 데이터셋을 혼합하여 텍스트 생성을 보정함으로써 더 높은 속임수 성공률를 달성하며, 표준 스팸 필터를 통과시킬 수 있음을 입증한다.

ABSTRACT

With an increasing number of malicious attacks, the number of people and organizations falling prey to social engineering attacks is proliferating. Despite considerable research in mitigation systems, attackers continually improve their modus operandi by using sophisticated machine learning, natural language processing techniques with an intent to launch successful targeted attacks aimed at deceiving detection mechanisms as well as the victims. We propose a system for advanced email masquerading attacks using Natural Language Generation (NLG) techniques. Using legitimate as well as an influx of varying malicious content, the proposed deep learning system generates extit{fake} emails with malicious content, customized depending on the attacker's intent. The system leverages Recurrent Neural Networks (RNNs) for automated text generation. We also focus on the performance of the generated emails in defeating statistical detectors, and compare and analyze the emails using a proposed baseline.

연구 동기 및 목표

  • 딥러닝을 활용한 표적성 악성 이메일 자동 생성의 가능성을 조사하는 것.
  • 합법적이고 피싱 성격이 있는 이메일 데이터를 혼합하여 훈련시켜 일관되고 의도에 맞는 가짜 이메일을 생성하는 시스템을 개발하는 것.
  • 생성된 이메일이 사전 훈련된 통계적 이메일 분류기에서 어떻게 회피되는지 평가하는 것.
  • 제안된 RNN 기반 시스템과 기준 기반 자연어 생성 도구(Dada Engine) 간의 성능을 비교하는 것.
  • 합성된 인간과 유사한 피싱 콘텐츠에 노출되었을 때 검출 시스템의 실패 모드와 오분류 패턴을 분석하는 것.

제안 방법

  • 시스템은 훈련 데이터에서 학습된 패턴을 바탕으로 순차적 텍스트를 생성하기 위해 순환 신경망(RNNs), 특히 장기 단기 기억(LSTM) 네트워크를 사용한다.
  • 출력의 다양성과 일관성의 균형을 확보하기 위해 온도 초모수를 사용해 텍스트 생성을 제어한다.
  • 악성 의도를 통합하면서도 스타일적 유사성을 유지하기 위해 합법적 이메일과 피싱 이메일이 각각 50%씩 포함된 혼합 데이터셋으로 모델을 보정한다.
  • 생성된 이메일의 품질과 검출 가능성 평가를 위해 Dada Engine 기반의 기준 시스템을 활용한다.
  • 스팸 분류를 위한 지지 벡터 기반(SVM) 기반의 통계적 검출을 수행하여 회피 성공 여부를 평가한다.
  • 오류 분석은 반복적인 텍스트 생성과 악성 이메일이 합법적으로 오분류되는 현상에 집중하며, 특히 링크가 전통적인 위치 외부에 배치된 경우에 초점이 맞춰진다.

실험 결과

연구 질문

  • RQ1RNN 기반 텍스트 생성은 일관성 있고 합법적인 이메일와 스타일적으로 유사한 표적성 악성 이메일을 생성할 수 있는가?
  • RQ2RNN으로 생성된 이메일은 역사적 피싱 패턴을 기반으로 훈련된 통계적 분류기에서 얼마나 잘 회피할 수 있는가?
  • RQ3위장성과 검출 가능성 측면에서 제안된 RNN 시스템은 기준 기반 자연어 생성 도구(Dada Engine)에 비해 어떤 성능을 보이는가?
  • RQ4링크 배치와 언어적 특징은 자동화된 검출기가 악성 이메일을 잘못 분류하는 데 어떤 역할을 하는가?
  • RQ5RNN으로 생성된 이메일의 주요 실패 모드는 무엇이며, 이는 검출 회피에 어떤 영향을 미치는가?

주요 결과

  • RNN 기반 시스템은 일관된 구조를 지닌 악성 의도를 내포한 이메일을 성공적으로 생성했지만, 일부 출력물은 문법 오류와 반복적인 어휘를 보였다.
  • SVM 기반 검출기에서 상당수의 RNN으로 생성된 이메일가 합법적 이메일로 오분류되었으며, 이는 통계적 분류에서 효과적인 회피를 의미한다.
  • 예를 들어 문장 중간에 링크가 삽입된 비표준 링크 배치 방식은 악성 콘텐츠를 포함하고 있음에도 불구하고 더 높은 회피율을 보였다.
  • 50%의 피싱 데이터 혼합으로 훈련된 모델은 Dada Engine 기준 시스템에 비해 더 위장성이 높은 이메일을 생성했으며, 특히 자연스러운 글쓰기 패턴을 모방하는 데서 뛰어난 성능을 보였다.
  • 반복적인 텍스트 생성, 예를 들어 '<NET>' 및 'ECT'와 같은 반복 태그는 일반적인 결함이었으며, 이는 모델의 한계나 훈련 데이터의 크기 부족 때문일 가능성이 높다.
  • 완벽하지는 않지만, 이 시스템은 딥러닝으로 생성된 이메일이 기존 검출 메커니즘을 우회할 수 있음을 입증하며, NLP 기반 사이버 공격의 위협이 점점 증가하고 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.