Skip to main content
QUICK REVIEW

[論文レビュー] A Suffix Tree Approach to Email Filtering

Rajesh Pampapathi, Boris Mirkin|ArXiv.org|Mar 14, 2005
Spam and Phishing Detection参考文献 26被引用数 7
ひとこと要約

この論文は、スパムを検出するためにメール本文を文字単位で分析するサフィックスツリーに基づくフィルタリング手法を提案している。従来のナイーブベイズなどのキーワードベース手法よりも優れた性能を発揮し、たとえば'Vi.agr.a'のようなオブスカレーションに対しても部分文字列を捉えることができる。これにより、マッチパーミュテーション正規化と最適なしきい値チューニングを組み合わせることで分類精度が向上する。

ABSTRACT

We present an approach to email filtering based on the suffix tree data structure. A method for the scoring of emails using the suffix tree is developed and a number of scoring and score normalisation functions are tested. Our results show that the character level representation of emails and classes facilitated by the suffix tree can significantly improve classification accuracy when compared with the currently popular methods, such as naive Bayes. We believe the method can be extended to the classification of documents in other domains.

研究の動機と目的

  • キーワードベースのスパムフィルタが、文字の挿入によるオブスカレーションを受けても検出できないという限界を是正すること。
  • メール分類における文字単位の分析にサフィックスツリーを用いる可能性を検討すること。
  • サフィックスツリーに基づくフィルタリングシステムにおける、さまざまなスコアリング関数および正規化関数の性能を評価すること。
  • 提案手法の正確性と頑健性を、従来のナイーブベイズ分類器と比較すること。
  • 最大のフィルタリング性能を得るために最適な設定パラメータ(しきい値および重要度関数)を特定すること。

提案手法

  • 訓練用メールデータからサフィックスツリーを構築し、テキストに含まれるすべての部分文字列を文字単位で表現する。
  • スパムおよびハムクラスのサフィックスツリー・プロファイルに含まれる部分文字列の頻度と重要度に基づいて、メールをスコア化する。
  • ルート、頻度、エントロピーに基づく関数などの重要度関数を用いて、部分文字列の関連性を重みづける。
  • マッチパーミュテーション正規化を適用して、異なるしきい値においてスコアの一貫性を高め、過学習を低減する。
  • 正規化されたスコア差に基づいて、新しいメールをスパムまたはハムに分類するしきい値ベースの意思決定ルールを採用する。
  • さまざまなしきい値において性能を動的に評価することで、誤検出率と誤検出率のバランスを最適化する。

実験結果

リサーチクエスチョン

  • RQ1サフィックスツリーを用いた文字単位の部分文字列分析は、語彙単位の手法と比較してスパム検出精度を向上させることができるか?
  • RQ2異なる重要度関数は、サフィックスツリー分類器の性能にどのように影響を与えるか?
  • RQ3正規化技術の影響は、フィルタリングシステムの頑健性と正確性にどのような影響を与えるか?
  • RQ4分類器の性能はしきい値の選択にどれほど敏感であり、最適なしきい値を一貫して特定できるか?
  • RQ5オブスカレーション手法が多様なメールデータセットにおいても、サフィックスツリー手法は高い性能を維持するか?

主な発見

  • サフィックスツリー分類器は、ナイーブベイズよりも高い分類精度を達成しており、特に'Vi.agr.a'のような文字の挿入によるオブスカレーションを受けても検出可能なスパムメッセージに対して顕著な優位性を示した。
  • マッチパーミュテーション正規化が最も効果的な正規化手法であり、すべての重要度関数およびしきい値設定において性能を向上させた。
  • ルート重要度関数がすべてのデータセットで最も一貫性を持って優れた性能を示し、他の関数よりもわずかに優れていた。
  • 誤検出率および誤検出率の曲線が、サフィックスツリー分類器ではより緩やかであったため、最適でないしきい値においても頑健性が高かった。
  • 性能はしきい値の選択に非常に敏感であり、最適なしきい値はデータセットごとに異なったため、適応的しきい値チューニングの必要性が示された。
  • 計算コストが高めではあるが、計算的に実行可能であり、正確性が求められるフィルタリングアプリケーションへの導入に強く有望であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。