Skip to main content
QUICK REVIEW

[论文解读] The Anatomy of Mitos Web Search Engine

Panagiotis Papadakos, Giorgos Vasiliadis|ArXiv.org|Mar 14, 2008
Web Data Mining and Analysis参考文献 11被引用 8
一句话总结

本文提出Mitos,一种基于数据库管理系统(DBMS)索引的Web搜索引擎,可实现可扩展、可维护且功能丰富的信息检索。尽管在存储空间和查询性能方面相较于Terrier等倒排文件系统有所不足,Mitos在可扩展性方面具有显著优势,并支持高级功能,如希腊语词干提取、实时结果聚类以及通过链接分析实现的垃圾信息检测。其在2,892秒内索引了14,246篇文档(占集合的97%以上),而Terrier仅在11,694秒内索引了11,699篇文档。

ABSTRACT

Engineering a Web search engine offering effective and efficient information retrieval is a challenging task. This document presents our experiences from designing and developing a Web search engine offering a wide spectrum of functionalities and we report some interesting experimental results. A rather peculiar design choice of the engine is that its index is based on a DBMS, while some of the distinctive functionalities that are offered include advanced Greek language stemming, real time result clustering, and advanced link analysis techniques (also for spam page detection).

研究动机与目标

  • 设计并实现一个功能丰富、可扩展的Web搜索引擎,支持高级语言处理与实时结果组织。
  • 评估使用DBMS作为主要索引结构而非传统倒排文件时的权衡。
  • 研究词干提取在多语言环境下对检索质量、摘要生成与查询扩展的影响。
  • 探索在类似生产环境中的实时结果聚类与分类体系构建的可行性与性能表现。
  • 基于真实网络数据集,将本系统的性能与可扩展性与成熟的IR系统(如Terrier)进行对比。

提出的方法

  • 系统使用关系型DBMS存储倒排索引,实现模式灵活性,并支持对已删除或新抓取文档的高效更新。
  • 爬虫递归地抓取网页,为每篇文档分配唯一ID,并将元数据与超链接存储在结构化文件中。
  • 索引器在存储词频、权重与PageRank前,应用词法分析、停用词过滤与希腊语词干提取。
  • 查询处理支持多种模型(向量模型、布尔模型、扩展布尔模型、模糊查询),并基于排名靠前的结果实现查询建议与扩展。
  • 通过多种算法实施实时结果聚类,文档摘要从提取的全文中生成。
  • 通过识别可疑页面供人工审查,提升垃圾信息检测效果,进而优化基于链接分析的排名算法。

实验结果

研究问题

  • RQ1在Web搜索中,基于DBMS的索引与传统倒排文件系统相比,在存储空间、索引时间与查询性能方面有何差异?
  • RQ2高级希腊语词干提取对检索召回率、索引大小以及查询建议与文档摘要质量有何影响?
  • RQ3实时结果聚类在多大程度上能改善Web搜索引擎中的用户导航与结果组织?
  • RQ4当结合人工反馈对可疑页面进行审查时,链接分析在垃圾信息检测中的有效性如何?
  • RQ5当文档集合规模扩大时,基于DBMS索引的系统性能特征如何?

主要发现

  • Mitos在2,892秒内索引了14,246篇文档(占集合的97.2%),显著优于Terrier v.1.1在11,694秒内仅索引11,699篇文档(占80.6%)的表现。
  • 基于DBMS的索引占用214.99 MB存储空间(占总量的7.4%),而Terrier仅使用23.8 MB(占0.8%),表明存在显著的存储开销。
  • Mitos的查询评估时间随查询词数量增加而上升,10个词的查询平均耗时0.3212秒,而Terrier在所有查询长度下均保持在亚毫秒级(0.0044秒)。
  • 尽管性能较慢,Mitos在召回率方面表现更优,当查询10个词时,平均比Terrier多返回90.23篇文档。
  • 词干提取提升了召回率并减小了索引大小,但对聚类名称的可读性与查询扩展建议的质量产生负面影响。
  • 语料库中的词频分布符合幂律分布,支持在系统设计中采用标准信息检索假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。