Skip to main content
QUICK REVIEW

[論文レビュー] Phishing Detection through Email Embeddings

Luis Felipe González Gutiérrez, Faranak Abri|arXiv (Cornell University)|Dec 28, 2020
Spam and Phishing Detection参考文献 21被引用数 4
ひとこと要約

本稿では、表面的特徴が類似している場合でも、文脈的意味を捉えることでフィッシングメールを検出するため、doc2vecに基づくメール埋め込みを提案する。テキスト的指標の類似性が著しいにもかかわらず、埋め込みの2次元線形PCA投影にランダムフォレストを適用することで、91.6%の正確性と90.0%のF1スコアを達成しており、意味的ベクトル化がフィッシングメールと正当なメールを効果的に区別できることを示している。

ABSTRACT

The problem of detecting phishing emails through machine learning techniques has been discussed extensively in the literature. Conventional and state-of-the-art machine learning algorithms have demonstrated the possibility of building classifiers with high accuracy. The existing research studies treat phishing and genuine emails through general indicators and thus it is not exactly clear what phishing features are contributing to variations of the classifiers. In this paper, we crafted a set of phishing and legitimate emails with similar indicators in order to investigate whether these cues are captured or disregarded by email embeddings, i.e., vectorizations. We then fed machine learning classifiers with the carefully crafted emails to find out about the performance of email embeddings developed. Our results show that using these indicators, email embeddings techniques is effective for classifying emails as phishing or legitimate.

研究の動機と目的

  • テキスト的特徴がほとんど同一である状況下でも、メール埋め込みに基づく機械学習モデルがフィッシングメールと正当なメールを区別できるかを調査すること。
  • 表面的類似性があるにもかかわらず、doc2vec埋め込みが意味的差をどのように捉えられるかを評価すること。
  • 従来の特徴が区別不能な状況下でも、メール埋め込みが分類の高精度を実現するための判別的特徴を保持しているかを特定すること。
  • 複数の分類器(SVM、ロジスティック回帰、ランダムフォレスト、ナイーブベイズ)を、完全な埋め込み空間と低次元投影の両方で比較して性能を評価すること。
  • 線形およびRBFカーネルPCAを用いた次元削減技術を用いて、メール埋め込みの背後にある構造を説明分散と併せて分析すること。

提案手法

  • 表面的特徴(言語的・構造的指標)が類似するように意図的に調整された、フィッシングメール12通と正当なメール12通のデータセットを構築した。
  • 各メールを意味的意味を捉える20次元の密ベクトル表現に変換するため、doc2vecを適用した。
  • 完全な20次元埋め込み空間上で、SVM、ロジスティック回帰、ランダムフォレスト、ナイーブベイズの複数の二値分類器を訓練した。
  • 可視化および分析の目的で、線形PCAおよびRBFカーネルPCAを用いて埋め込みを2次元に投影する次元削減を実施した。
  • 異なる埋め込み表現および分類器タイプにおけるモデル性能を、正確性およびF1スコアを用いて評価した。
  • 最初の数個の主成分が埋め込みの全分散のどの程度を占めているかを特定するため、説明分散分析を実施した。

実験結果

リサーチクエスチョン

  • RQ1表面的特徴がほぼ同一である状況下でも、メール埋め込みがフィッシングメールと正当なメールを効果的に区別できるか?
  • RQ2doc2vecで生成されたメール埋め込みを用いた場合、異なる機械学習分類器の性能はどのようになるか?
  • RQ3メール埋め込みの背後にある構造は、意味空間において線形分離可能か、非線形分離可能か?
  • RQ4埋め込み空間の分散のどの程度が、高精度な分類を達成するために十分か?
  • RQ52次元の埋め込み投影が、元の20次元特徴空間の判別的性能をどの程度保持しているか?

主な発見

  • ランダムフォレスト分類器は、2次元線形PCA投影を用いることで、元の分散の25%しか使用しないにもかかわらず、91.6%の正確性と90.0%のF1スコアを達成し、最高の性能を示した。
  • SVMは元の20次元埋め込み空間で最高の性能を示し、81.6%の正確性と76.6%のF1スコアを達成した。
  • 2次元線形PCA投影が、元の20次元空間およびRBFカーネルPCA投影を上回ったことから、埋め込み構造が概ね線形的であることが示唆された。
  • RBFカーネルPCA投影はやや低い性能(78.3%の正確性、76.6%のF1スコア)を示し、この非線形投影ではクラス分離が不十分であることが示された。
  • 説明分散分析の結果、全分散の90%が最初の12個の主成分で占められ、埋め込み空間の内因的次元数が低いことが明らかになった。
  • 複数の分類器および投影方法で一貫した高い性能が得られたことから、doc2vec埋め込みがフィッシングメールと正当なメールの意味的差を効果的に符号化していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。