Skip to main content
QUICK REVIEW

[论文解读] ClueWeb22: 10 Billion Web Documents with Visual and Semantic Information

Arnold Overwijk, Chenyan Xiong|arXiv (Cornell University)|Nov 29, 2022
Web Data Mining and Analysis被引用 5
一句话总结

ClueWeb22 是一个从商业搜索引擎索引中提取的 100 亿页网页语料库,旨在反映真实世界网络搜索的分布特征,内容经过高质量清洗。该语料库包含丰富的视觉与语义信号——包括渲染后的网页、解析的 DOM 结构以及神经网络 NLP 标注——使其成为首个公开发布的、大规模、工业级质量的网络数据集,适用于信息检索、自然语言处理和人工智能预训练领域的学术研究。

ABSTRACT

ClueWeb22, the newest iteration of the ClueWeb line of datasets, provides 10 billion web pages affiliated with rich information. Its design was influenced by the need for a high quality, large scale web corpus to support a range of academic and industry research, for example, in information systems, retrieval-augmented AI systems, and model pretraining. Compared with earlier ClueWeb corpora, the ClueWeb22 corpus is larger, more varied, of higher-quality, and aligned with the document distributions in commercial web search. Besides raw HTML, ClueWeb22 includes rich information about the web pages provided by industry-standard document understanding systems, including the visual representation of pages rendered by a web browser, parsed HTML structure information from a neural network parser, and pre-processed cleaned document text to lower the barrier to entry. Many of these signals have been widely used in industry but are available to the research community for the first time at this scale.

研究动机与目标

  • 为解决信息检索与自然语言处理领域中缺乏大规模、高质量且真实的网络语料库的问题。
  • 提供一个能真实反映网络搜索流量分布的网络语料库,涵盖网络的‘头部’与‘尾部’内容,与旧有的或采样数据集(如 MS MARCO)不同。
  • 首次大规模地向研究人员提供丰富的工业标准网络信号,如浏览器渲染的视觉效果、解析的 HTML 以及语义嵌入。
  • 通过预先计算从原始网络数据中提取的干净文本、文档字段和锚图,降低研究门槛。
  • 通过提供一个真实、高质量的网络数据源,支持检索增强型人工智能和大语言模型预训练的新兴研究。

提出的方法

  • 该语料库通过从商业搜索引擎的索引中采样 100 亿个网页构建而成,优先选择用户参与度更高、与搜索查询更相关的页面。
  • 定义了三个类别:ClueWeb22-B(2 亿页)用于最热门的‘超级头部’页面,ClueWeb22-A(20 亿页)用于高频访问的‘头部’页面,ClueWeb22-L(100 亿页)用于平衡的‘头部与尾部’分布。
  • 使用神经网络解析器处理原始 HTML,以提取结构化的 DOM 信息,并通过浏览器渲染为每一页生成视觉表示。
  • 预处理包括去重、垃圾内容过滤以及成人内容移除,以确保数据质量。
  • 已预先计算干净的文本、文档元数据和锚图,并作为数据集的标准组件提供。
  • 数据集通过卡内基梅隆大学和 Lemur 项目进行许可与分发,支持大规模传输,费用低廉。

实验结果

研究问题

  • RQ1如何构建一个大规模、高质量的网络语料库,以真实反映现实世界网络搜索流量的分布?
  • RQ2丰富的视觉与语义信号(如渲染后的网页图像和神经网络 NLP 标注)在多大程度上能提升学术网络语料库的真实感与实用性?
  • RQ3公开可用的工业级网络语料库在多大程度上能缩小商业 AI 实验室与学术研究人员之间的数据获取差距?
  • RQ4与 MS MARCO 或 C4 等现有数据集相比,ClueWeb22 在数据质量、覆盖范围以及网络内容代表性方面表现如何?
  • RQ5对预计算的干净文本和结构化元数据的访问,在多大程度上能加速检索增强型人工智能和语言模型预训练的研究?

主要发现

  • ClueWeb22 包含 100 亿个网页,其中 ClueWeb22-B(超级头部)有 2 亿页,ClueWeb22-A(头部)有 20 亿页,ClueWeb22-L(头部与尾部)有 100 亿页,真实反映了搜索流量分布。
  • 该数据集包含浏览器渲染的视觉表示、解析的 DOM 结构以及来自生产级 NLP 模型的语义标注,支持在视觉与语义理解方面的高级研究。
  • 已预先计算干净的文本、文档字段和锚图,降低了研究门槛,使研究人员可立即用于下游任务。
  • 该语料库采用非商业许可,大规模传输费用极低,确保学术界与非营利研究机构的广泛可及性。
  • ClueWeb22 是首个公开发布的数据集,能够大规模提供工业标准的网络信号(如视觉渲染与语义解析),弥合了学术研究中的关键空白。
  • 通过从商业搜索引擎索引中采样,ClueWeb22 比旧数据集(如 ClueWeb09 或 ClueWeb12)或衍生语料库(如 MS MARCO)更能真实反映现实世界的网络搜索行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。