[논문 리뷰] Phishing Detection through Email Embeddings
이 논문은 표면적 특성에서 유사한 피싱 이메일과 정상 이메일 간의 의미적 차이를 포착함으로써, doc2vec 기반 이메일 임베딩을 사용하여 피싱 이메일을 탐지하는 방법을 제안한다. 비록 텍스트적 지표에서 높은 유사성을 보이지만, 이 방법은 임베딩의 2D 선형 주성분 분석(PCA) 투영에 기반한 랜덤 포레스트를 사용하여 91.6%의 정확도와 90.0%의 F1 스코어를 달성하며, 의미적 벡터화가 피싱 이메일과 정상 이메일을 효과적으로 구분함을 보여준다.
The problem of detecting phishing emails through machine learning techniques has been discussed extensively in the literature. Conventional and state-of-the-art machine learning algorithms have demonstrated the possibility of building classifiers with high accuracy. The existing research studies treat phishing and genuine emails through general indicators and thus it is not exactly clear what phishing features are contributing to variations of the classifiers. In this paper, we crafted a set of phishing and legitimate emails with similar indicators in order to investigate whether these cues are captured or disregarded by email embeddings, i.e., vectorizations. We then fed machine learning classifiers with the carefully crafted emails to find out about the performance of email embeddings developed. Our results show that using these indicators, email embeddings techniques is effective for classifying emails as phishing or legitimate.
연구 동기 및 목표
- 텍스트적 특성이 거의 동일한 상황에서 기계학습 모델이 이메일 임베딩을 기반으로 피싱 이메일과 정상 이메일을 구분할 수 있는지 조사하기 위해.
- 피싱 이메일과 정상 이메일의 내용이 표면적으로 유사하더라도 doc2vec 임베딩이 의미적 차이를 효과적으로 포착할 수 있는지 평가하기 위해.
- 기존의 특징이 구분되지 않을 때도 이메일 임베딩이 분류 정확도를 높이는데 기여하는 분류 가능 특징을 유지하는지 확인하기 위해.
- 다양한 분류기(SVM, 로지스틱 회귀, 랜덤 포레스트, 나이브 베이즈)가 전체 임베딩 공간과 저차원 투영에 대해 어떻게 성능을 내는지 비교하기 위해.
- 주성분 분석(PCA)과 같은 기법을 활용해 이메일 임베딩의 잠재적 구조를 분석하기 위해(선형 및 RBF 커널 PCA 포함)
제안 방법
- 의도적으로 언어적 및 구조적 지표가 유사하도록 12개의 피싱 이메일과 12개의 정상 이메일을 포함한 데이터셋을 구축하여 의미적 차이를 고립시켰다.
- 각 이메일를 의미를 반영하는 20차원의 조밀한 벡터 표현으로 변환하기 위해 doc2vec를 적용했다.
- 전체 20차원 임베딩 공간에서 랜덤 포레스트, SVM, 로지스틱 회귀, 나이브 베이즈 등의 이진 분류기를 훈련시켰다.
- 시각화 및 분석을 위해 임베딩을 2차원으로 투영하기 위해 선형 PCA와 RBF 커널 PCA를 활용해 차원 축소를 수행했다.
- 다양한 임베딩 표현과 분류기 유형에 대해 정확도와 F1 스코어를 사용해 모델 성능을 평가했다.
- 주성분 분석을 통해 첫 번째 몇 개의 주성분이 임베딩의 총 분산의 몇 퍼센트를 차지하는지 분석했다.
실험 결과
연구 질문
- RQ1피싱 이메일과 정상 이메일이 거의 동일한 표면적 특성을 공유할 때, 이메일 임베딩이 이 둘을 효과적으로 구분할 수 있는가?
- RQ2다양한 기계학습 분류기가 doc2vec로 생성된 이메일 임베딩을 기반으로 얼마나 잘 성능을 내는가?
- RQ3이메일 임베딩의 잠재적 구조는 의미 공간에서 선형적 또는 비선형적으로 분리 가능한가?
- RQ4임베딩 공간의 분산 중 어느 정도의 비율이 높은 분류 정확도를 달성하는 데에 충분한가?
- RQ52D 투영된 임베딩이 원래의 20차원 특징 공간의 분류 능력을 어느 정도 유지하는가?
주요 결과
- 랜덤 포레스트 분류기는 임베딩의 2D 선형 PCA 투영을 사용했을 때 91.6%의 정확도와 90.0%의 F1 스코어를 기록하며 가장 높은 성능을 보였으며, 이는 원래 분산의 25%만 사용한 상황이었다.
- SVM는 원래의 20차원 임베딩 공간에서 가장 높은 성능을 보였으며, 정확도 81.6%, F1 스코어 76.6%를 기록했다.
- 2D 선형 PCA 투영이 원래의 20차원 공간과 RBF 커널 PCA 투영보다 뛰어난 성능을 보였으며, 이는 임베딩의 잠재적 구조가 약간의 선형성을 띠고 있음을 시사한다.
- RBF 커널 PCA 투영은 다소 낮은 성능(정확도 78.3%, F1 스코어 76.6%)을 보였으며, 이는 비선형 투영에서 클래스 간 분류가 덜 효과적임을 나타낸다.
- 설명된 분산 분 析 결과, 첫 12개의 주성분이 총 분산의 90%를 차지함을 확인했으며, 이는 임베딩 공간의 내재 차원 수가 낮음을 시사한다.
- 다양한 분류기와 투영 방식에서 일관된 높은 성능이 나타난 점은, doc2vec 임베딩이 피싱 이메일과 정상 이메일 간의 의미적 차이를 효과적으로 캐릭터라이징하고 있음을 뒷받침한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.