[论文解读] Web Archive Analytics
本文介绍了由Webis研究小组开发的大规模网页存档分析基础设施,用于处理来自互联网档案馆和Common Crawl的8 PB网页存档数据。通过利用分布式存储(Ceph)、Kubernetes编排以及Hadoop/Spark数据处理管道,该系统支持无偏见的大规模网页演化研究,可在工业规模下实现高级自然语言处理和搜索任务。
Web archive analytics is the exploitation of publicly accessible web pages and their evolution for research purposes -- to the extent organizationally possible for researchers. In order to better understand the complexity of this task, the first part of this paper puts the entirety of the world's captured, created, and replicated data (the "Global Datasphere") in relation to other important data sets such as the public internet and its web pages, or what is preserved thereof by the Internet Archive. Recently, the Webis research group, a network of university chairs to which the authors belong, concluded an agreement with the Internet Archive to download a substantial part of its web archive for research purposes. The second part of the paper in hand describes our infrastructure for processing this data treasure: We will eventually host around 8 PB of web archive data from the Internet Archive and Common Crawl, with the goal of supplementing existing large scale web corpora and forming a non-biased subset of the 30 PB web archive at the Internet Archive.
研究动机与目标
- 为应对学术研究中分析海量、动态演化的网页存档所面临的挑战,构建高性能、可扩展的基础设施。
- 使研究人员能够访问并处理互联网档案馆30 PB数据集中具有代表性且无偏见的子集。
- 通过提供持久的分布式存储和计算资源,支持大规模自然语言处理、搜索和机器学习研究。
- 通过向外部研究人员提供面向公众的服务和基础设施访问,促进协作研究。
提出的方法
- 该系统采用多层基础设施堆栈,包括数据获取、管理、分析和消费层。
- 采用基于Ceph的分布式对象存储系统,通过RadosGW S3 API网关和纠删编码实现数据持久性和可扩展性。
- 使用Kubernetes在130个节点的集群上编排服务,通过Ceph RBD实现持久化存储,临时数据则存储在HDFS中。
- Hadoop YARN、Spark和JupyterHub支持大规模数据处理和交互式分析。
- 该基础设施支持多项公共服务,如args.me、ChatNoir、Netspeak、Picapica和Tira,用于支持搜索、论点挖掘和评估任务。
- 通过Consul实现服务发现,通过Prometheus实现事件日志记录和告警,确保系统监控。
实验结果
研究问题
- RQ1研究人员如何以前所未有的规模访问并分析大规模、具有代表性的网页存档数据,而这种规模此前仅限于大型科技公司?
- RQ2需要何种基础设施才能可靠且高效地存储和处理8 PB的网页存档数据?
- RQ3研究团队如何利用公开和开放的数据源,构建并运营一个无偏见、大规模的网页存档分析平台?
- RQ4此类基础设施在支持大规模先进自然语言处理和搜索研究中发挥何种作用?
- RQ5如何通过协作共享的基础设施支持多样化的研究任务,包括查询日志分析、近似重复检测和变换器模型训练?
主要发现
- Webis基础设施目前托管2.3 PB的网页存档数据,其中560 TB来自互联网档案馆,其余数据来自Common Crawl。
- 该系统设计可扩展至8 PB的网页存档数据,构成互联网档案馆30 PB数据集中无偏见的子集。
- 该基础设施使此前仅大型科技公司可实现的大规模研究项目成为可能,包括大规模机器学习模型的训练。
- 该平台支持多个面向公众的服务,如ChatNoir、args.me和Tira,促进搜索、论点挖掘和评估任务的开展。
- 系统使用Ceph实现持久、可扩展的对象存储,使用Kubernetes实现可靠的服务编排,并通过Prometheus和Consul实现监控。
- 该基础设施已支持大规模查询日志研究、网页搜索中的近似重复检测以及大规模自然语言处理语料库的构建。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。