[논문 리뷰] Documenting the English Colossal Clean Crawled Corpus.
이 논문은 Common Crawl에서 유래한 대규모로 필터링된 텍스트 코퍼스인 Colossal Clean Crawled Corpus(C4)에 대한 최초의 종합적인 문서화를 제공한다. 데이터 소스 분석, 특히 아프리카계 미국인 영어(AAE)에 미치는 필터링 영향 분석, 포함된 벤치마크 예제 식별, 그리고 공동체가 탐색할 수 있도록 제공된 인터랙티브 웹 인터페이스를 포함한다.
As language models are trained on ever more text, researchers are turning to some of the largest corpora available. Unlike most other types of datasets in NLP, large unlabeled text corpora are often presented with minimal documentation, and best practices for documenting them have not been established. In this work we provide the first documentation for the Colossal Clean Crawled Corpus (C4; Raffel et al., 2020), a dataset created by applying a set of filters to a single snapshot of Common Crawl. We begin with a high-level summary of the data, including distributions of where the text came from and when it was written. We then give more detailed analysis on salient parts of this data, including the most frequent sources of text (e.g., this http URL, which contains a significant percentage of machine translated and/or OCR'd text), the effect that the filters had on the data (they disproportionately remove text in AAE), and evidence that some other benchmark NLP dataset examples are contained in the text. We release a web interface to an interactive, indexed copy of this dataset, encouraging the community to continuously explore and report additional findings.
연구 동기 및 목표
- 현재 표준화된 문서화가 부족한 대규모 비라벨 텍스트 코퍼스의 문서화에 최선의 실천 방안을 수립하기 위해.
- 자료 기원, 시간 분포, 소스 특성 등을 포함한 Colossal Clean Crawled Corpus(C4)에 대한 상세한 분석을 제공하기 위해.
- 특히 아프리카계 미국인 영어(AAE)에 미치는 영향을 중심으로 필터링 절차가 언어 다양성에 미치는 영향을 분석하기 위해.
- C4 코퍼스 내에 알려진 벤치마크 NLP 데이터셋 예제가 포함되어 있는지 식별하고 검증하기 위해.
- 지속적인 공동체 탐색과 발견을 지원하기 위해 인터랙티브이고 색인된 웹 인터페이스를 공개하기 위해.
제안 방법
- 저자들은 C4의 텍스트 기원과 시간 분포를 추적하기 위해 Common Crawl 데이터셋의 단일 스크래치 샘플을 분석한다.
- 기계 번역 또는 OCR 처리된 콘텐츠 비율이 높은 URL을 포함해, 텍스트의 가장 빈번한 소스를 식별하고 분류한다.
- 특히 아프리카계 미국인 영어(AAE) 텍스트에 미치는 영향을 중심으로 필터링 파이프라인의 언어 다양성에 대한 영향을 평가한다.
- C4 코퍼스 내에 알려진 벤치마크 NLP 예제(GLEU, SuperGLUE 등)가 존재하는지 체계적으로 검색한다.
- 인터랙티브하고 실시간 탐색이 가능한 색인된 웹 인터페이스를 구축하고 공개한다.
실험 결과
연구 질문
- RQ1Colossal Clean Crawled Corpus의 주요 소스와 시간 분포는 무엇인가?
- RQ2C4에서 사용된 필터링 절차는 아프리카계 미국인 영어(AAE)와 같은 특정 언어 다양성의 표현에 어떤 영향을 미치는가?
- RQ3기존의 벤치마크 NLP 데이터셋이 C4 코퍼스에 어느 정도 포함되어 있는가?
- RQ4C4에서 가장 빈번한 URL에서 지배적인 텍스트 유형(예: 기계 번역, OCR 처리)은 무엇인가?
- RQ5인터랙티브이고 색인된 인터페이스는 대규모 텍스트 코퍼스에 대한 공동체 참여와 지속적인 분석을 어떻게 향상시킬 수 있는가?
주요 결과
- C4에서 가장 빈번한 소스는 기계 번역 및/또는 OCR 처리된 텍스트 비율이 매우 높은 단일 URL이다.
- 필터링 파이프라인이 아프리카계 미국인 영어(AAE) 텍스트를 비율적으로 더 많이 제거하여 최종 코퍼스 내에서의 표현 비율을 감소시킨다.
- GLUE 및 SuperGLUE에서 유래한 알려진 벤치마크 NLP 데이터셋 예제들이 C4 코퍼스 내에 존재하는 것이 확인되었다.
- 이 데이터셋은 저품질 또는 자동화된 콘텐츠 웹 크롤링에서 유래한 상당 부분을 포함하는 다양한 텍스트 소스를 포함하고 있다.
- 인터랙티브이고 색인된 웹 인터페이스의 공개는 실시간 탐색을 가능하게 하며, 공동체 기반의 코퍼스 특성 탐색을 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.