[论文解读] Improving Spam Detection Based on Structural Similarity
本文提出了一种垃圾邮件检测算法,通过利用邮件发件人和收件人通讯录之间的结构相似性来减少误报。通过将用户建模为互惠联系空间中的向量并基于相似性聚类,该方法利用辅助分类器的历史标签对垃圾邮件或正常邮件状态进行概率推断,在真实世界的SMTP日志数据集上将误报率降低了33%。
We propose a new detection algorithm that uses structural relationships between senders and recipients of email as the basis for the identification of spam messages. Users and receivers are represented as vectors in their reciprocal spaces. A measure of similarity between vectors is constructed and used to group users into clusters. Knowledge of their classification as past senders/receivers of spam or legitimate mail, comming from an auxiliary detection algorithm, is then used to label these clusters probabilistically. This knowledge comes from an auxiliary algorithm. The measure of similarity between the sender and receiver sets of a new message to the center vector of clusters is then used to asses the possibility of that message being legitimate or spam. We show that the proposed algorithm is able to correct part of the false positives (legitimate messages classified as spam) using a testbed of one week smtp log.
研究动机与目标
- 为应对垃圾邮件日益增长的挑战,目前垃圾邮件已占所有邮件的83%,且由于对抗性规避技术的出现,检测难度持续上升。
- 识别可用于垃圾邮件检测的稳定、难以更改的标识符,重点关注发件人和收件人通讯录中的结构模式,而非易变的内容特征。
- 通过利用用户之间的结构相似性,结合基于辅助分类器的概率聚类方法,减少现有垃圾邮件过滤器中的误报。
- 证明通讯录中的结构相似性可提升垃圾邮件检测系统的准确性,特别是在纠正被错误标记为垃圾邮件的正常邮件方面。
提出的方法
- 将每个邮件发件人和收件人表示为多维空间中的二值向量,该空间由所有可能的联系人定义,每个维度表示是否曾向该联系人发送或接收过邮件。
- 使用基于余弦的相似性度量计算用户向量之间的结构相似性,根据共享的联系模式将用户分组为聚类。
- 使用辅助垃圾邮件分类器将过去发送者和收件人标记为垃圾邮件或正常邮件,然后根据垃圾邮件/正常邮件成员的比例,对聚类应用概率标签。
- 对于新邮件,通过测量发件人和收件人通讯录向量之间的相似性及其与聚类中心的距离,评估其为垃圾邮件或正常邮件的可能性。
- 调整算法参数以平衡精确率与召回率,优化为最小化误报率,同时保持高检测率。
- 使用巴西一所大学的真实SMTP日志数据集验证该方法,并与SpamAssassin的分类结果进行对比。
实验结果
研究问题
- RQ1电子邮件通讯录中的结构相似性能否作为区分垃圾邮件与正常邮件流量的稳定且有效标识符?
- RQ2当与辅助分类器结合时,结构聚类在多大程度上能减少垃圾邮件检测中的误报?
- RQ3在误报率降低方面,所提出方法与现有基于内容的垃圾邮件过滤器相比表现如何?
- RQ4该算法能否通过跟踪随时间变化的通讯录结构变化来检测演化中的垃圾邮件发送者行为?
主要发现
- 将该算法应用于相同测试数据集后,误报率从SpamAssassin原始分类的60.33%降低至39.67%。
- 该方法成功根据结构相似性将用户分组为聚类,且聚类与辅助分类器确定的垃圾邮件或正常邮件状态具有显著相关性。
- 尽管发件人姓名、域名和邮件内容发生对抗性变化,通讯录中的结构相似性仍比基于内容的特征更稳定,因而成为垃圾邮件检测的稳健标识符。
- 该算法在纠正误判方面表现出有效性,尤其能将先前被辅助系统错误标记为垃圾邮件的正常邮件重新分类。
- 概率聚类框架可与贝叶斯推理和协同过滤集成,支持基于用户反馈和外部分类器输出的持续优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。