QUICK REVIEW
[论文解读] Improving spam filtering by combining Naive Bayes with simple k-nearest neighbor searches
Daniel Etzold|ArXiv.org|Nov 30, 2003
Spam and Phishing Detection参考文献 4被引用 3
一句话总结
本文提出一种混合垃圾邮件过滤方法,结合朴素贝叶斯与k近邻(kNN)搜索,使用欧几里得距离或余弦角度相似度。通过以相等权重融合两种模型的概率得分,该方法提升了分类准确率——尤其在正常邮件上表现更优,同时将特征维度从2000降低至500,当k=1且V=2000时,正常邮件的准确率最高达到99.25%。
ABSTRACT
Using naive Bayes for email classification has become very popular within the last few months. They are quite easy to implement and very efficient. In this paper we want to present empirical results of email classification using a combination of naive Bayes and k-nearest neighbor searches. Using this technique we show that the accuracy of a Bayes filter can be improved slightly for a high number of features and significantly for a small number of features.
研究动机与目标
- 通过整合k近邻分类,提升朴素贝叶斯的垃圾邮件过滤准确率,超越标准朴素贝叶斯方法。
- 减少实现高准确率所需的特征数量,降低计算成本。
- 最小化正常邮件分类中的误报,因其代价高于漏报。
- 评估结合朴素贝叶斯与kNN时,使用欧几里得距离与余弦角度作为相似度度量的有效性。
提出的方法
- 使用加权平均得分 δ = (αPrnb + βPrknn)/(α + β),将朴素贝叶斯概率与kNN概率相结合,其中 α = β = 1。
- 在kNN中使用文档向量之间的欧几里得距离与余弦角度作为相似度度量。
- 应用信息增益将特征维度降低至500、1000、1500和2000个特征。
- 通过小写转换、去除HTML标签、提取长度≥2个字符的单词与数字,并为每个HTML标签附加'tag'标记,对邮件进行分词。
- 基于较高δ得分进行邮件分类:δG ≥ 0.5 为'正常',否则为'垃圾邮件'。
- 采用kNN方法,k ∈ {1, 2, 3, 4, 5},并在多个训练/测试划分(25:75、30:70、40:60)上评估性能。
实验结果
研究问题
- RQ1与仅使用朴素贝叶斯相比,结合朴素贝叶斯与kNN是否能提升垃圾邮件过滤的准确率?
- RQ2该混合方法是否能在不牺牲准确率的前提下,显著降低特征维度?
- RQ3哪种相似度度量方式——欧几里得距离或余弦角度——能带来更好的分类性能?
- RQ4kNN在混合模型中的最优k值是多少?该值在垃圾邮件与正常邮件分类中是否存在差异?
- RQ5该混合模型是否能显著减少正常邮件分类中的误报?
主要发现
- 当使用余弦角度相似度、V=2000且k=1时,混合模型在正常邮件分类中的准确率达到99.25%,超过仅使用朴素贝叶斯的方法。
- 在V=500个特征时,混合模型在正常邮件分类中的准确率达到99.10%(k=1),高于使用V=2000特征的朴素贝叶斯模型的98.65%准确率。
- 误报数量大幅减少,尤其在k=1时表现尤为显著,表明该方法在最小化误报方面极为有效。
- 在低维特征(V=500)下,垃圾邮件分类的最佳准确率出现在k=2,优于使用V=2000特征的朴素贝叶斯模型。
- 余弦角度相似度度量与欧几里得距离表现相当,两者在不同特征维度下均展现出高准确率与强鲁棒性。
- 仅使用500个特征,且k=1或k=2时,准确率高于使用2000个特征的朴素贝叶斯模型,显著降低计算成本的同时提升了性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。