Skip to main content
QUICK REVIEW

[论文解读] Rules of Acquisition for Mementos and Their Content

Shawn Jones, Harihar Shankar|arXiv (Cornell University)|Feb 19, 2016
Web Data Mining and Analysis参考文献 12被引用 4
一句话总结

本文识别出在多个存档中获取和提取网页快照(web mementos)文本时面临的关键挑战,揭示了基于HTTP的检索方法常因非标准重定向、基于JavaScript的重定向以及HTML渲染不一致而失败。作者表明,通常需要使用PhantomJS等工具,且lxml和Beautiful Soup等解析库在处理格式错误或存档修改过的HTML时面临问题,显著影响数字保存和链接失效缓解工作的文本提取可靠性。

ABSTRACT

Text extraction from web pages has many applications, including web crawling optimization and document clustering. Though much has been written about the acquisition of content from live web pages, content acquisition of archived web pages, known as mementos, remains a relatively new enterprise. In the course of conducting a study with almost 700,000 web pages, we encountered issues acquiring mementos and extracting text from them. The acquisition of memento content via HTTP is expected to be a relatively painless exercise, but we have found cases to the contrary. We also find that the parsing of HTML, already known to be problematic, can be more complex when one attempts to extract the text of mementos across many web archives, due to issues involving different memento presentation behaviors, as well as the age of the HTML in their mementos. For the benefit of others acquiring mementos across many web archives, we document those experiences here.

研究动机与目标

  • 调查在多个网页存档中获取快照的可靠性与一致性,以支持研究目的。
  • 识别使用标准HTTP方法检索和提取归档网页(快照)文本时面临的技术障碍。
  • 记录不同网页存档通过品牌标识、重定向和HTML呈现方式对快照内容进行修改的情况,这些修改影响了文本提取。
  • 评估常见文本提取工具(如lxml、Beautiful Soup)在处理快照内容时的有效性,并识别解析的边界情况。
  • 为研究人员提供实用解决方案和意识提升,以实现跨存档比较快照内容,支持数字保存和语义分析。

提出的方法

  • 使用cURL和标准HTTP GET从网页存档中检索快照,识别出仅靠直接检索失败的案例。
  • 使用PhantomJS配合自定义脚本处理基于JavaScript的重定向和基于框架的内容加载,尤其针对WebCite和互联网档案馆的快照。
  • 实现了一种回退字符编码检测算法,当存档提供的编码失败时,默认使用UTF-8。
  • 应用lxml和Beautiful Soup进行HTML解析,指出其在处理未闭合标签、格式错误的noscript元素和特殊字符编码时的局限性。
  • 开发了针对特定存档的内容剥离技术,以去除品牌标识和导航元素,避免干扰文本比较。
  • 丢弃了因标签表示不标准(如使用&lt;和&gt;而非<和>)而扭曲文本比较的快照,原因是解析不一致。

实验结果

研究问题

  • RQ1网页存档在提供快照时,与标准HTTP行为偏离的程度如何,特别是在重定向处理方面?
  • RQ2不同存档在HTML渲染和内容修改方面的差异如何影响文本提取的准确性和一致性?
  • RQ3标准解析库(如Beautiful Soup、lxml)在处理来自多样化存档的快照内容时存在哪些局限性?
  • RQ4快照中编码问题和格式错误的HTML如何影响文本提取以及跨存档的后续比较?
  • RQ5与直接HTTP方法相比,使用PhantomJS等浏览器模拟工具进行快照获取在性能和可靠性方面存在哪些权衡?

主要发现

  • 数据集中约25%的快照仅靠标准HTTP GET无法获取,原因在于非RESTful行为,如基于JavaScript的重定向和基于框架的内容加载。
  • WebCite需要使用PhantomJS处理基于会话的重定向和框架加载,导致近10万个快照的获取时间超过一个月,而互联网档案馆仅需约两周。
  • 互联网档案馆经常将HTTP 302重定向替换为基于JavaScript的模拟重定向,需执行客户端代码才能访问实际的快照内容。
  • 使用lxml解析时,未闭合标签和格式错误的noscript元素引发解析问题,有时因DOM状态解析错误导致完全丢失文本。
  • 部分存档将<和>替换为&lt;和&gt;,解析工具将其解释为纯文本,引入虚假标签,扭曲文本比较结果。
  • 字符编码常被错误报告,因此需要自定义检测算法并以UTF-8作为回退,以确保可靠文本提取。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。