Skip to main content
QUICK REVIEW

[论文解读] A Suffix Tree Approach to Email Filtering

Rajesh Pampapathi, Boris Mirkin|ArXiv.org|Mar 14, 2005
Spam and Phishing Detection参考文献 26被引用 7
一句话总结

本文提出了一种基于后缀树的电子邮件过滤方法,通过在字符级别分析电子邮件内容来检测垃圾邮件,其性能优于传统的基于关键词的方法(如朴素贝叶斯)。通过捕获无论是否经过混淆(例如 'Vi.agr.a')的子串,该方法在结合匹配排列归一化和最优阈值调优时,实现了更高的分类准确率。

ABSTRACT

We present an approach to email filtering based on the suffix tree data structure. A method for the scoring of emails using the suffix tree is developed and a number of scoring and score normalisation functions are tested. Our results show that the character level representation of emails and classes facilitated by the suffix tree can significantly improve classification accuracy when compared with the currently popular methods, such as naive Bayes. We believe the method can be extended to the classification of documents in other domains.

研究动机与目标

  • 解决基于关键词的垃圾邮件过滤器在检测经过混淆的垃圾邮件消息时的局限性。
  • 探索在电子邮件分类中使用后缀树进行字符级别分析的可行性。
  • 评估在基于后缀树的过滤系统中,各种评分函数与归一化函数的性能表现。
  • 将所提方法的准确率与鲁棒性与传统的朴素贝叶斯分类器进行对比。
  • 识别出能实现最大过滤性能的配置参数,如阈值与显著性函数。

提出的方法

  • 该方法从训练电子邮件数据构建后缀树,以在字符级别表示文本的所有子串。
  • 根据后缀树中垃圾邮件与正常邮件类别子串的频率与显著性对电子邮件进行评分。
  • 使用显著性函数(包括根函数、频率函数和基于熵的函数)来加权子串的相关性。
  • 应用匹配排列归一化以提高评分的一致性,并减少在不同阈值下的过拟合现象。
  • 基于两类之间的归一化得分差异,采用基于阈值的决策规则将新邮件分类为垃圾邮件或正常邮件。
  • 该方法动态评估不同阈值下的性能表现,以在误报率与漏报率之间取得平衡。

实验结果

研究问题

  • RQ1与基于词的方法相比,使用后缀树进行字符级别的子串分析是否能提高垃圾邮件检测的准确率?
  • RQ2不同的显著性函数如何影响后缀树分类器的性能表现?
  • RQ3归一化技术对过滤系统的鲁棒性与准确率有何影响?
  • RQ4分类器的性能对阈值选择的敏感程度如何?是否能持续识别出最优阈值?
  • RQ5该后缀树方法在包含不同混淆技术的多样化电子邮件数据集上是否能保持高性能?

主要发现

  • 后缀树分类器在分类准确率上优于朴素贝叶斯方法,尤其在检测经过混淆的垃圾邮件消息(如关键词通过插入字符被伪装)方面表现更优。
  • 匹配排列归一化是最有效的归一化方法,在所有显著性函数与阈值设置下均提升了性能表现。
  • 根显著性函数在所有数据集上表现最为稳定,相较于其他函数展现出微弱的优越性。
  • 后缀树分类器的误报率与漏报率曲线更为平缓,表明其在非最优阈值下也具备更好的鲁棒性。
  • 性能对阈值选择高度敏感,最优阈值因数据集而异,表明需要采用自适应的阈值调优策略。
  • 尽管计算开销较高,但该方法在计算上是可行的,并在对准确率要求较高的过滤应用中展现出强大的部署潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。