QUICK REVIEW
[論文レビュー] Improving spam filtering by combining Naive Bayes with simple k-nearest neighbor searches
Daniel Etzold|ArXiv.org|Nov 30, 2003
Spam and Phishing Detection参考文献 4被引用数 3
ひとこと要約
この論文では、ユークリッド距離またはコサイン角類似度を用いたk近傍法(kNN)検索と組み合わせたハイブリッドスパムフィルタリング手法を提案する。両モデルの確率スコアを等重みで統合することで、特に正当なメールの分類精度が向上し、特徴量次元を2000から500に低減。k=1およびV=2000の場合、正当なメールの分類精度が最大99.25%に達する。
ABSTRACT
Using naive Bayes for email classification has become very popular within the last few months. They are quite easy to implement and very efficient. In this paper we want to present empirical results of email classification using a combination of naive Bayes and k-nearest neighbor searches. Using this technique we show that the accuracy of a Bayes filter can be improved slightly for a high number of features and significantly for a small number of features.
研究の動機と目的
- 標準的なNaive Bayesを上回るスパムフィルタリング精度を達成するため、k近傍法分類を統合する。
- 高い精度を維持しつつ、必要な特徴量の数を削減し、計算コストを低減する。
- 誤検出(偽陽性)は偽陰性よりもコストが高いため、正当なメール分類における誤検出を最小限に抑える。
- ユークリッド距離とコサイン角の両方を類似度測度として用いて、Naive BayesとkNNを統合する有効性を評価する。
提案手法
- 重み付き平均スコア δ = (αPrnb + βPrknn)/(α + β) を用いて、Naive Bayesの確率とkNNの確率を統合し、α = β = 1とする。
- kNNの類似度測度として、文書ベクトル間のユークリッド距離とコサイン角を用いる。
- 特徴量次元を500、1000、1500、2000に低減するために情報ゲインを適用する。
- メールを小文字に変換し、HTMLタグを除去し、2文字以上の単語および数字を抽出し、各HTMLタグに対して「html」という語を付加することでトークン化を行う。
- δスコアが0.5以上の場合を「正当」と分類し、それ以外を「スパム」と分類する。
- k ∈ {1, 2, 3, 4, 5} のkNNを用い、複数のトレーニング/テスト分割(25:75、30:70、40:60)で性能を評価する。
実験結果
リサーチクエスチョン
- RQ1Naive Bayes単体と比較して、Naive BayesとkNNを統合することでスパムフィルタリング精度が向上するか?
- RQ2ハイブリッドアプローチにより、精度を損なわず特徴量次元を大幅に低減できるか?
- RQ3ユークリッド距離とコサイン角のどちらの類似度測度がより優れた分類性能を示すか?
- RQ4ハイブリッドモデルにおけるkNNの最適なk値は何か?また、スパムと正当なメールの分類においてその値はどのように異なるか?
- RQ5ハイブリッドモデルにより、正当なメール分類における誤検出を顕著に低減できるか?
主な発見
- V=2000およびk=1でコサイン角類似度を用いた場合、ハイブリッドモデルは正当なメール分類で99.25%の精度を達成し、単独のNaive Bayesを上回る。
- V=500の特徴量でk=1とした場合、ハイブリッドモデルは正当なメールで99.10%の精度を達成し、V=2000のNaive Bayesの98.65%を上回る。
- 誤検出の数は顕著に減少し、特にk=1の場合に顕著で、誤検出を最小限に抑える効果的なアプローチである。
- スパム分類においては、低次元特徴量(V=500)を用いた場合、k=2で最高の精度が得られ、V=2000のNaive Bayesを上回る。
- コサイン角類似度はユークリッド距離と同等の精度と頑健性を示し、特徴量次元にかかわらず高い性能を発揮する。
- 500の特徴量を用い、k=1またはk=2とすることで、2000の特徴量を用いたNaive Bayesを上回る精度が得られ、計算コストを顕著に低減しながら性能が向上する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。