Skip to main content
QUICK REVIEW

[论文解读] Efficient and Effective Spam Filtering and Re-ranking for Large Web Datasets

Gordon V. Cormack, Mark D. Smucker|arXiv (Cornell University)|Apr 29, 2010
Spam and Phishing Detection参考文献 21被引用 14
一句话总结

本论文提出了一种高效的内容驱动型垃圾信息过滤与重排序方法,适用于大规模网络数据集,仅需极少的训练和自动化标注。通过使用仅2.5小时人工标注样例训练的简单逻辑回归分类器,对ClueWeb09数据集中的垃圾页面进行过滤或重排序,该方法在所有TREC 2009测试中显著提升了检索效果——固定截断精度(estP10)和基于排名的指标(MAP、StatMAP)均有提升。

ABSTRACT

The TREC 2009 web ad hoc and relevance feedback tasks used a new document collection, the ClueWeb09 dataset, which was crawled from the general Web in early 2009. This dataset contains 1 billion web pages, a substantial fraction of which are spam --- pages designed to deceive search engines so as to deliver an unwanted payload. We examine the effect of spam on the results of the TREC 2009 web ad hoc and relevance feedback tasks, which used the ClueWeb09 dataset. We show that a simple content-based classifier with minimal training is efficient enough to rank the "spamminess" of every page in the dataset using a standard personal computer in 48 hours, and effective enough to yield significant and substantive improvements in the fixed-cutoff precision (estP10) as well as rank measures (estR-Precision, StatMAP, MAP) of nearly all submitted runs. Moreover, using a set of "honeypot" queries the labeling of training data may be reduced to an entirely automatic process. The results of classical information retrieval methods are particularly enhanced by filtering --- from among the worst to among the best.

研究动机与目标

  • 开发一种实用方法,仅用极少计算和训练资源,对10亿页的ClueWeb09数据集中的每一页进行垃圾信息与否的标注。
  • 量化垃圾信息过滤在大规模网络信息检索任务中对检索效果的影响。
  • 通过使用“蜜罐”查询实现自动、无监督的训练数据标注,从而消除人工判断的需要。
  • 证明垃圾信息过滤与重排序能显著提升各类检索系统(包括主流搜索引擎提供商的系统)的标准信息检索指标。

提出的方法

  • 使用逻辑回归训练的内容驱动型垃圾信息分类器,仅需极少人工标注样本(最少仅2.5小时标注时间)。
  • 利用“蜜罐”查询——专为检索垃圾页面而设计的合成查询——自动生成无需人工干预的标注训练数据。
  • 采用百分位数垃圾信息评分方法,按垃圾信息程度对所有页面进行排序,从而实现灵活的过滤或重排序阈值设定。
  • 通过重排序而非简单过滤的方式将垃圾信息评分整合到现有检索结果中,以在压制垃圾内容的同时保留相关文档。
  • 采用50折交叉验证,评估不同截断水平和基于排名的指标下垃圾信息过滤与重排序的影响。
  • 利用四年前、性质不同且规模更小的数据集进行训练,以证明该方法的可迁移性与鲁棒性。

实验结果

研究问题

  • RQ1能否在仅使用极少人工标注数据的情况下,高效地为大规模网络数据集训练出一种简单的内容驱动型垃圾信息分类器?
  • RQ2在大规模网络数据集的即席检索与相关性反馈任务中,垃圾信息过滤在多大程度上提升了检索效果?
  • RQ3通过蜜罐查询实现自动、无监督的训练数据标注,是否能在无需人工判断的情况下实现有效的垃圾信息检测?
  • RQ4基于垃圾信息程度评分的重排序与简单过滤相比,在提升标准信息检索指标(如MAP和P@10)方面表现如何?
  • RQ5所提出的方法是否能在包括商业搜索引擎提供商在内的多种检索系统中提升检索性能?

主要发现

  • 在所有TREC 2009即席检索提交结果中,该垃圾信息过滤器平均使estP10(固定截断精度)提升了32%,p值 < 0.0001。
  • 该方法显著提升了基于排名的指标:MAP从0.1195提升至0.1510(相对提升26.4%),StatMAP从0.0400提升至0.0528(相对提升32%)。
  • 使用垃圾信息评分进行重排序,使表现最佳的检索系统(uvamrftop)的P@10从0.4100提升至0.4855,即使该系统本身已使用垃圾信息过滤,仍实现了显著增益。
  • 仅通过2.5小时的人工标注,该方法即实现了有效的垃圾信息检测,且所生成的垃圾信息评分在使用四年前、性质不同的小规模数据集进行训练后依然有效。
  • 检索效果的提升在所有截断水平下均保持一致,且经50折交叉验证确认具有统计显著性。
  • 作者公开发布了四组垃圾信息程度百分位数评分(每组约350MB压缩后),可供下载,以支持可复现性并便于未来信息检索系统集成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。