Skip to main content
QUICK REVIEW

[论文解读] Reconstructing Websites for the Lazy Webmaster

Frank McCown, Joan A. Smith|arXiv (Cornell University)|Dec 16, 2005
Web Data Mining and Analysis参考文献 31被引用 4
一句话总结

本文提出 Warrick,一种工具,可从公共网络存储库(如互联网档案馆和搜索引擎缓存,包括 Google、MSN、Yahoo)自动重建网站。通过利用现有的爬取数据和缓存内容,Warrick 已成功重建了 24 个真实网站,平均恢复了 89% 的 HTML 文件、53% 的图片和 85% 的 PDF 文件,其中 Google 是最一致的缓存内容来源。

ABSTRACT

Backup or preservation of websites is often not considered until after a catastrophic event has occurred. In the face of complete website loss, "lazy" webmasters or concerned third parties may be able to recover some of their website from the Internet Archive. Other pages may also be salvaged from commercial search engine caches. We introduce the concept of "lazy preservation"- digital preservation performed as a result of the normal operations of the Web infrastructure (search engines and caches). We present Warrick, a tool to automate the process of website reconstruction from the Internet Archive, Google, MSN and Yahoo. Using Warrick, we have reconstructed 24 websites of varying sizes and composition to demonstrate the feasibility and limitations of website reconstruction from the public Web infrastructure. To measure Warrick's window of opportunity, we have profiled the time required for new Web resources to enter and leave search engine caches.

研究动机与目标

  • 解决因疏忽或基础设施故障导致网站丢失后缺乏系统性恢复机制的问题。
  • 探究公开可用的网络存储库——尤其是搜索引擎缓存和互联网档案馆——是否可作为重建丢失网站的可行来源。
  • 开发并评估一种利用现有网络基础设施自动化重建过程的工具。
  • 测量主要搜索引擎和互联网档案馆中缓存网络资源的时间可用性。
  • 评估仅从外部、公开可访问来源重建网站的可行性与局限性,而无需事先备份。

提出的方法

  • 设计并实现 Warrick,一个命令行工具,递归爬取四个公共网络存储库:互联网档案馆(IA)、Google、MSN 和 Yahoo。
  • 使用 Warrick 重建 24 个实际网站,涵盖不同规模和内容类型的网站,以评估重建成功率。
  • 创建包含 HTML、PDF 和图像文件的合成网站集合,分别在 .com 和 .edu 域名下,以测量搜索引擎中的缓存延迟和持续时间。
  • 系统性地在创建后移除页面,并监控其在搜索引擎缓存中保留的时间,以确定其可用窗口期。
  • 应用启发式规则优先处理带时间戳的资源,避免无法获取或已修改的版本(如缩略图或 HTML 转换版)。
  • 汇总所有存储库的贡献,计算每个网站及每类文件的总体重建成功率。

实验结果

研究问题

  • RQ1公共网络存储库——特别是搜索引擎缓存和互联网档案馆——在多大程度上能够有效支持丢失网站的重建?
  • RQ2在创建后,网络资源在 Google、MSN 和 Yahoo 中平均保留多长时间?
  • RQ3哪个网络存储库对网站重建贡献最大?它们在不同文件类型上的恢复率如何比较?
  • RQ4网站规模、PageRank 或内容类型(如 HTML、图片、PDF)在多大程度上影响重建成功率?
  • RQ5仅从外部视图重建网站存在哪些局限性?哪些组件(如服务器端逻辑)无法被恢复?

主要发现

  • 在 24 个重建网站中,HTML 文件平均成功恢复率达 89%,是恢复率最高的资源类型。
  • 图片恢复率为 53%,显著低于 HTML,主要由于缓存不一致,以及 MSN 无法缓存图片。
  • PDF 文件的恢复率为 85%,而 Microsoft Office 格式文件的恢复率为 71%。
  • Google 平均贡献最多(44%),其次是 MSN(30%)、IA(19%)和 Yahoo(7%)。
  • HTML 资源的平均恢复时间(TUR)在 8 至 61 天之间,许多资源可保持高达 90 天的可用性。
  • 重建成功率与网站规模或 PageRank 无关,表明即使较小或不那么受欢迎的网站也能被有效恢复。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。