[논문 리뷰] ClueWeb22: 10 Billion Web Documents with Visual and Semantic Information
ClueWeb22는 상업용 검색 엔진의 인덱스에서 유래한 100억 개의 웹 페이지로 구성된 웹 코퍼스로, 실제 웹 검색 분포를 반영하고 고품질의 정제된 콘텐츠를 제공하도록 설계되었다. 렌더링된 페이지, 구문 분석된 DOM 구조, 신경망 기반 NLP 주석 등 풍부한 시각적 및 의미적 신호를 포함하고 있어, 정보 검색, 자연어 처리 및 AI 미사전훈련 분야에서 학술 연구를 위해 공개된 최초의 대규모 산업 수준의 웹 데이터셋이다.
ClueWeb22, the newest iteration of the ClueWeb line of datasets, provides 10 billion web pages affiliated with rich information. Its design was influenced by the need for a high quality, large scale web corpus to support a range of academic and industry research, for example, in information systems, retrieval-augmented AI systems, and model pretraining. Compared with earlier ClueWeb corpora, the ClueWeb22 corpus is larger, more varied, of higher-quality, and aligned with the document distributions in commercial web search. Besides raw HTML, ClueWeb22 includes rich information about the web pages provided by industry-standard document understanding systems, including the visual representation of pages rendered by a web browser, parsed HTML structure information from a neural network parser, and pre-processed cleaned document text to lower the barrier to entry. Many of these signals have been widely used in industry but are available to the research community for the first time at this scale.
연구 동기 및 목표
- 정보 검색 및 자연어 처리 분야에서 대규모, 고품질, 현실적인 웹 코퍼스가 부족한 문제를 해결하기 위해.
- 기존의 MS MARCO와 같은 오래된 또는 샘플링된 데이터셋과 달리, 웹 검색 트래픽의 진정한 분포—'헤드'와 '테일'을 모두 반영한 웹 코퍼스를 제공하기 위해.
- 브라우저 렌더링된 시각적 신호, 분석된 HTML, 의미적 임bedding 등 산업 표준 웹 신호를 연구자들이 처음으로 대규모로 활용할 수 있도록 하기 위해.
- 원시 웹 데이터에서 정제된 텍스트, 문서 필드, 앵커 그래프를 사전에 계산하여 연구자의 진입 장벽을 낮추기 위해.
- 검색 기반 증강 AI 및 대규모 언어 모델 미사전훈련 분야의 신규 연구를 지원하기 위해 현실적이고 고품질의 웹 데이터 소스를 제공하기 위해.
제안 방법
- 코퍼스는 상업용 검색 엔진의 인덱스에서 사용자 참여도와 검색 쿼리에 대한 관련성이 높은 페이지를 우선순위로 100억 개의 웹 페이지를 샘플링하여 구축되었다.
- 세 가지 카테고리로 정의됨: ClueWeb22-B(2억 개 페이지)는 가장 인기 있는 '슈퍼 헤드' 페이지 전용, ClueWeb22-A(20억 개 페이지)는 자주 방문되는 '헤드' 페이지 전용, ClueWeb22-L(100억 개 페이지)는 균형 잡힌 '헤드와 테일' 분포를 반영.
- 원시 HTML은 신경망 기반 파서를 사용해 구조화된 DOM 정보를 추출하고, 각 페이지에 대해 브라우저 렌더링을 통해 시각적 표현을 생성함.
- 정제 과정으로서 중복 제거, 스팸 필터링, 성인 콘텐츠 제거를 수행하여 고품질 데이터를 확보함.
- 정제된 텍스트, 문서 메타데이터, 앵커 그래프를 사전에 계산하여 표준화된 데이터셋 구성 요소로 제공함.
- 코퍼스는 캐네기 멜론 대학과 레미어 프로젝트를 통해 라이선스 및 배포가 이루어졌으며, 대용량 전송에 대해 저비용 배포가 가능함.
실험 결과
연구 질문
- RQ1실제 웹 검색 트래픽 분포를 반영하는 대규모, 고품질 웹 코퍼스를 어떻게 구성할 수 있는가?
- RQ2렌더링된 페이지 이미지 및 신경망 기반 NLP 주석과 같은 풍부한 시각적 및 의미적 신호는 학술 웹 코퍼스의 현실성과 유용성을 얼마나 향상시킬 수 있는가?
- RQ3공개된 산업 수준의 웹 코퍼스는 상용 AI 연구소와 학술 연구자 간의 데이터 접근 격차를 줄일 수 있는가?
- RQ4ClueWeb22는 MS MARCO나 C4와 같은 기존 데이터셋과 비교해 데이터 품질, 커버리지 및 웹 콘텐츠의 대표성 측면에서 어떻게 다를 수 있는가?
- RQ5정제된 텍스트 및 구조화된 메타데이터를 사전에 계산해 제공하는 것이 검색 기반 증강 AI 및 언어 모델 미사전훈련 분야의 연구 가속화에 어떤 영향을 미치는가?
주요 결과
- ClueWeb22는 총 100억 개의 웹 페이지를 포함하며, ClueWeb22-B(슈퍼 헤드)는 2억 개, ClueWeb22-A(헤드)는 20억 개, ClueWeb22-L(헤드와 테일)은 100억 개로 구성되어 실제 검색 트래픽 분포를 반영한다.
- 코퍼스는 브라우저 렌더링된 시각적 표현, 분석된 DOM 구조, 프로덕션 수준의 NLP 모델에서 유도된 의미 주석을 포함하여 시각적 및 의미적 이해 연구에 고도로 활용 가능하다.
- 정제된 텍스트, 문서 필드, 앵커 그래프가 사전에 계산되어 연구자의 진입 장벽을 낮추었으며, 후속 작업에 즉각적으로 활용 가능하다.
- 비상업적 라이선스 하에 배포되며, 대용량 전송에 대해 최소한의 비용이 부과되어 학계 및 비영리 연구자들에게 광범위하게 접근 가능하다.
- ClueWeb22는 산업 표준 웹 신호—예: 시각적 렌더링, 의미적 구문 분석—을 대규모로 공개한 최초의 공개 데이터셋으로, 학술 연구의 핵심 격차를 메우는 데 기여한다.
- 상업용 검색 엔진의 인덱스에서 샘플링함으로써, ClueWeb09나 ClueWeb12와 같은 오래된 데이터셋이나 MS MARCO와 같은 파생 코퍼스보다 실제 웹 검색 행동을 더 잘 반영한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.