[논문 리뷰] Web Archive Analytics
이 논문은 웹이 연구 그룹이 인터넷 아카이브와 커몬 크롤에서 8PB의 웹 아카이브 데이터를 처리할 수 있도록 하는 대규모 웹 아카이브 분석 인프라를 제시한다. 분산 스토리지(Ceph), 쿠버네티스 오케스트레이션, Hadoop/Spark 파이프라인을 활용하여 웹 진화에 대한 편향 없는 대규모 연구를 가능하게 하며, 산업 규모의 고급 NLP 및 검색 작업을 지원한다.
Web archive analytics is the exploitation of publicly accessible web pages and their evolution for research purposes -- to the extent organizationally possible for researchers. In order to better understand the complexity of this task, the first part of this paper puts the entirety of the world's captured, created, and replicated data (the "Global Datasphere") in relation to other important data sets such as the public internet and its web pages, or what is preserved thereof by the Internet Archive. Recently, the Webis research group, a network of university chairs to which the authors belong, concluded an agreement with the Internet Archive to download a substantial part of its web archive for research purposes. The second part of the paper in hand describes our infrastructure for processing this data treasure: We will eventually host around 8 PB of web archive data from the Internet Archive and Common Crawl, with the goal of supplementing existing large scale web corpora and forming a non-biased subset of the 30 PB web archive at the Internet Archive.
연구 동기 및 목표
- 학술 연구를 위해 거대하고 변화하는 웹 아카이브를 분석하는 도전 과제를 해결하기 위해 고성능이고 확장 가능한 인프라를 구축하기 위해.
- 연구자가 30PB의 인터넷 아카이브 컬렉션에서 대표성 있고 편향 없는 서브셋을 접근하고 처리할 수 있도록 하기 위해.
- 지속 가능한 분산 스토리지와 컴퓨팅 자원을 제공하여 대규모 NLP, 검색 및 머신러닝 연구를 지원하기 위해.
- 외부 연구자들에게 공개 서비스와 인프라 액세스를 제공함으로써 협업 연구를 촉진하기 위해.
제안 방법
- 데이터 수집, 관리, 분석, 소비 레이어로 구성된 다층 인프라 스택을 사용한다.
- 내구성과 확장성을 확보하기 위해 RadosGW S3 API 게이트웨이와 에러 코딩을 활용한 Ceph 기반 분산 객체 스토리지 시스템을 적용한다.
- 130개 노드 클러스터에서 쿠버네티스가 서비스를 오케스트레이션하며, Ceph RBD를 통한 영구 스토리지와 HDFS를 통한 일시적 데이터를 활용한다.
- Hadoop YARN, Spark, JupyterHub를 통해 대규모 데이터 처리와 상호작용 분석을 지원한다.
- 검색, 논거 마이닝, 평가를 위한 공개 서비스인 args.me, ChatNoir, Netspeak, Picapica, Tira를 지원한다.
- 서비스 디스covery를 위한 Consul과 이벤트 로깅 및 경고를 위한 Prometheus를 통해 모니터링을 보장한다.
실험 결과
연구 질문
- RQ1이전에는 산업 분야에서만 가능했던 규모로 연구자들이 대규모이고 대표적인 웹 아카이브 데이터에 어떻게 접근하고 분석할 수 있는가?
- RQ2신뢰성과 성능을 확보하면서 8PB의 웹 아카이브 데이터를 저장하고 처리하기 위해 어떤 인프라가 필요한가?
- RQ3공개 및 오픈 데이터 소스를 활용하여 연구 팀이 편향 없고 대규모의 웹 아카이브 분석 플랫폼을 어떻게 구축하고 운영할 수 있는가?
- RQ4이러한 인프라는 어떤 역할을 하여 고급 NLP 및 검색 연구를 대규모로 가능하게 하는가?
- RQ5협업적이고 공유 가능한 인프라는 어떻게 다양한 연구 작업, 예를 들어 쿼리 로그 분석, 근접 중복 탐지, 트랜스포머 모델 훈련을 지원하는가?
주요 결과
- 웹이 연구 그룹의 인프라는 현재 2.3PB의 웹 아카이브 데이터를 호스팅하고 있으며, 이 중 560TB는 인터넷 아카이브에서 유래했고, 나머지는 커몬 크롤에서 유래했다.
- 시스템은 8PB의 웹 아카이브 데이터를 처리하도록 설계되어 있으며, 30PB의 인터넷 아카이브 컬렉션에서 편향 없는 서브셋을 형성한다.
- 이 인프라는 이전에는 대규모 기술 기업들만 가능했던 대규모 연구 프로젝트, 예를 들어 대규모 머신러닝 모델 훈련을 가능하게 한다.
- ChatNoir, args.me, Tira와 같은 여러 공개 서비스를 지원하여 검색, 논거 마이닝, 평가를 촉진한다.
- 지속 가능한 확장 가능한 객체 스토리지와 모니터링을 위한 Prometheus 및 Consul를 통한 신뢰성 있는 서비스 오케스트레이션을 위해 Ceph를 사용한다.
- 이 인프라는 거대한 쿼리 로그 분석, 웹 검색에서의 근접 중복 탐지, 대규모 NLP 코퍼스 준비와 같은 연구를 이미 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.