Skip to main content
QUICK REVIEW

[논문 리뷰] Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus

Jesse Dodge, Maarten Sap|arXiv (Cornell University)|2021. 04. 18.
Natural Language Processing Techniques인용 수 7
한 줄 요약

이 논문은 주요 언어 모델을 훈련하는 데 사용된 대규모 웹 텍스트 코퍼스인 Colossal Clean Crawled Corpus(C4)에 대한 종합적인 문서화를 제공한다. 데이터 원천, 콘텐츠 품질, 필터링 영향을 분석하여 기계 생성 텍스트의 상당한 비중, 벤치마크 데이터셋으로부터의 오염, 少수어권 언어 텍스트의 편향된 제거를 드러내며, 웹 스케일 자연어 처리 데이터셋에 다층적 문서화를 권장한다.

ABSTRACT

Large language models have led to remarkable progress on many NLP tasks, and researchers are turning to ever-larger text corpora to train them. Some of the largest corpora available are made by scraping significant portions of the internet, and are frequently introduced with only minimal documentation. In this work we provide some of the first documentation for the Colossal Clean Crawled Corpus (C4; Raffel et al., 2020), a dataset created by applying a set of filters to a single snapshot of Common Crawl. We begin by investigating where the data came from, and find a significant amount of text from unexpected sources like patents and US military websites. Then we explore the content of the text itself, and find machine-generated text (e.g., from machine translation systems) and evaluation examples from other benchmark NLP datasets. To understand the impact of the filters applied to create this dataset, we evaluate the text that was removed, and show that blocklist filtering disproportionately removes text from and about minority individuals. Finally, we conclude with some recommendations for how to created and document web-scale datasets from a scrape of the internet.

연구 동기 및 목표

  • 대규모 웹 크롤링 언어 데이터셋(예: C4)에 대한 철저한 문서화 부족 문제를 해결하기 위해, 최첨단 언어 모델을 훈련시키는 데 핵심적인 역할을 하는 데이터셋의 문서화 필요성을 제기한다.
  • 특히 특허 및 정부 웹사이트와 같은 예상치 못한 원천을 포함해 C4의 텍스트 기원과 구성 요소를 조사한다.
  • 블록리스트 기반 제거와 같은 필터링 메커니즘이 소수어권 언어 집단, 특히 아프리카계 미국어 및 끈적성 소수자 커뮤니티 콘텐츠에 미치는 영향을 평가한다.
  • 민족어휘와 감성 사전의 공존 패턴을 분석하여 C4 내 감성 편향을 정량화함으로써 특정 민족 집단에 대한 긍정성 편향의 불균형을 드러낸다.
  • 향후 웹 스케일 NLP 데이터셋의 재현 가능성과 공정성을 향상시키기 위해 표준화된 다층 문서화(메타데이터, 콘텐츠, 배제 기록)를 권장한다.

제안 방법

  • 2019년 4월 Common Crawl 스냅샷에서 유래한 C4.en 데이터셋을 수집하고 분석하며, 도메인 수준 메타데이터와 텍스트 수준 필터링 기법을 활용한다.
  • 언어 식별 모델(langdetect)을 훈련 및 적용하여 99% 이상의 신뢰도로 영어로 분류된 문서만 유지한다.
  • 토큰화 및 공존 분석을 통해 뉴욕타임스, 알자지라 등 도메인 전용 서브셋과 C4 간에 '유대인'과 '아랍' 같은 민족어휘의 감성 패턴을 비교한다.
  • VADER, SocialSent, UNQOVER 질문에서 수작업으로 수집한 사전을 포함한 여러 감성 사전을 평가하여 목표 민족어휘가 포함된 문단의 감성 극성 추정치를 산출한다.
  • 블록리스트 기반 필터링을 적용하여 아프리카계 미국어 및 끈적성 소수자 정체성 관련 언어 양식의 텍스트가 비례적으로 제거되는지 확인한다.
  • C4의 세 가지 필터링된 버전, 색인화된 검색 인터페이스, 공개 토론 저장소를 운영하여 재현 가능성과 공동체 기반 분석을 지원한다.

실험 결과

연구 질문

  • RQ1C4 코퍼스의 주요 텍스트 원천은 무엇이며, 일반 웹 콘텐츠의 기대 분포와 비교해보면 어떻게 되는가?
  • RQ2C4 코퍼스는 얼마나 많은 기계 생성 텍스트나 벤치마크 NLP 데이터셋으로부터의 오염을 포함하고 있는가?
  • RQ3특히 블록리스트 기반 제거와 같은 필터링 메커니즘이 소수어권 언어 집단의 표현에 어떤 영향을 미치는가?
  • RQ4특정 민족 정체성에 대해 C4 내 감성 편향은 무엇이며, 다양한 도메인과 감성 사전 간에 어떻게 다를 수 있는가?
  • RQ5웹 스케일 언어 데이터셋을 위한 종합적이고 다층적 문서화 프레임워크의 핵심 구성 요소는 무엇인가?

주요 결과

  • C4는 일반 웹 텍스트 코퍼스와 일반적으로 연관되지 않는, 미국 군부 웹사이트(.mil)와 특허 데이터베이스에서 유래한 상당한 양의 텍스트를 포함하고 있다.
  • SocialSent 사전를 사용한 '유대인'을 포함한 문단의 감성 지닌 토큰 중 약 73.2%가 긍정으로 분류되었으며, '아랍'의 경우 65.7%로, '유대인'에 대해 7.5%p의 긍정성 격차가 발생했다.
  • 블록리스트 기반 필터링은 아프리카계 미국어나 끈적성 소수자 정체성 관련 콘텐츠와 연관된 언어 양식의 텍스트를 비례적으로 더 많이 제거했다.
  • UnifiedQA 모델은 '유대인'에 대해 67.1%의 긍정성 연관성을 보였지만, '아프리카'에 대해서는 단지 36.6%에 불과하여 C4의 훈련 데이터에 기반한 강한 모델 수준의 편향이 드러났다.
  • 감성 편향은 도메인에 따라 달라졌다: 뉴욕타임스에서는 '유대인'에 대해 '아랍'보다 4.5%p의 긍정성 격차를 보였지만, 알자지라에서는 거의 차이가 없었으며(각각 42.5% 대 42.8%), 이는 맥락 기반 편향의 존재를 시사한다.
  • 이 연구는 C4의 세 가지 필터링된 버전, 색인화된 검색 인터페이스, 공개 토론 포럼을 공개하여 재현 가능성과 공동체 기반 분석를 지원했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.