[논문 리뷰] Towards a Cleaner Document-Oriented Multilingual Crawled Corpus
이 논문은 OSCAR 21.09에서 유도된 문서 중심의 다국어 웹 코퍼스를 제안하며, Ungoliant 파이프라인을 재설계하여 라인 수준이 아닌 문서 수준에서 언어를 분류함으로써 문서의 통합성을 유지하고, 새로운 자동 주석을 통해 개선된 필터링을 가능하게 한다. 주요 기여는 12GB의 다국어 코퍼스인 OSCAR 22.01로, 중복 제거, 라인 필터링, 메타데이터 주석을 통해 품질 인식 기반의 필터링이 가능하게 하여 NLP 및 디지털 인문학 응용 분야에서의 사용성을 향상시킨다.
The need for raw large raw corpora has dramatically increased in recent years with the introduction of transfer learning and semi-supervised learning methods to Natural Language Processing. And while there have been some recent attempts to manually curate the amount of data necessary to train large language models, the main way to obtain this data is still through automatic web crawling. In this paper we take the existing multilingual web corpus OSCAR and its pipeline Ungoliant that extracts and classifies data from Common Crawl at the line level, and propose a set of improvements and automatic annotations in order to produce a new document-oriented version of OSCAR that could prove more suitable to pre-train large generative language models as well as hopefully other applications in Natural Language Processing and Digital Humanities.
연구 동기 및 목표
- 기존의 다국어 웹 코퍼스인 OSCAR와 같이 라인 수준에서의 언어 분류 방식이 문서를 분할하고 가독성을 해칠 수 있는 한계를 해결하기 위해.
- 웹 크롤링 및 처리 과정에서 문서 수준의 통합성을 유지함으로써 후속 NLP 작업의 데이터 품질과 사용성을 향상시키기 위해.
- 문서 길이, 성인 내용, 중복 제거 표시자 등의 자동 주석을 통해 노이즈를 감소시키고 필터링 기능을 향상시키기 위해.
- 대규모 크롤링 코퍼스를 생성적 언어 모델 훈련 및 저자원 언어 응용 분야에서 더 효과적으로 활용할 수 있도록 하기 위해.
- 블록리스트 기반 주석의 한계를 분석함으로써, 특히 LGBQTI+ 콘텐츠에 대해 편향과 과도한 필터링을 완화하기 위해.
제안 방법
- 라인 수준이 아닌 문서 수준에서 언어를 분류하도록 Ungoliant 파이프라인을 재설계하여 일관된 문서 경계를 확보함.
- 연속된 라인이 100자 이상인 경우에만 라인을 유지하는 라인 필터링을 구현하여 문서 구조와 가독성을 유지함.
- 문서 길이(짧음, 보통, 길음), URL 블록리스트 기반 성인 콘텐츠 분류, 중복 제거 표시자 등을 포함한 메타데이터 주석을 추가함.
- 문서 수준과 라인 수준에서 모두 중복 제거를 적용하여, 특히 영어와 같은 고자원 언어에서의 중복을 감소시킴.
- 블록리스트 기반의 성인 콘텐츠 필터를 사용하여 잠재적으로 노골적인 콘텐츠를 주석 처리하였으며, 프랑스어 코퍼스 샘플을 통해 검증함.
- 예를 들어 5라인 이상의 하드 임계값과 같은 하드 조건이 문서 분류와 품질 인식에 미치는 영향을 평가함.
실험 결과
연구 질문
- RQ1라인 수준에서 문서 수준으로 언어 분류 방식을 전환할 경우, NLP 작업에서 코퍼스의 품질과 사용성에 어떤 영향을 미치는가?
- RQ2길이 및 성인 콘텐츠 필터링과 같은 자동 주석이 대규모 크롤링 코퍼스 내에서 사용 가능한 문서의 탐색 가능성과 품질을 얼마나 향상시키는가?
- RQ3예를 들어 최소 라인 수와 같은 하드 임계값이 문서 분류 및 데이터 품질 인식에 어떤 영향을 미치는가?
- RQ4블록리스트 기반의 성인 콘텐츠 주석 시스템이 비표준 또는 LGBQTI+ 관련 콘텐츠를 과도하게 필터링하지 않고 명시적인 콘텐츠를 효과적으로 식별하는 데 얼마나 효과적인가?
- RQ5중복 제거 및 문서 수준 처리가 저자원 언어에서 언어 다양성을 유지하면서도 중복을 상당히 줄일 수 있는가?
주요 결과
- 새로운 OSCAR 22.01 코퍼스는 짧고 분할된 라인을 필터링함으로써 문서의 통합성을 유지하여 더 일관되고 인간이 읽기 쉬운 문서를 제공한다.
- 코퍼스에는 중복 제거된 영어 콘텐츠를 포함한 12GB의 다국어 데이터셋과 라인 중복 제거 도구가 포함되어 있어 중복을 감소시켰다.
- 프랑스어 코퍼스에서 성인으로 분류된 문서 약 3.2%가 LGBQTI+ 관련이었으며, 이는 블록리스트 기반 주석 방식에서 과도한 필터링과 표현 편향이 존재할 수 있음을 시사한다.
- 성인 콘텐츠 검출에서 100개의 샘플 문서 중 21개에서 잘못된 양성 결과가 관찰되었으며, 이는 비표준 교육 콘텐츠나 이전에 성인 콘텐츠에 사용된 웹사이트를 포함했다.
- 길이 기반 주석 분석 결과, 체코어 문서의 약 50%가 '긴'으로 분류되었으며, 이는 중간에서 고자원 언어에서 품질 문제 또는 라인 길이의 이질성 가능성을 시사한다.
- 파이프라인은 독일어 코퍼스 내에 약 30MB의 아일레만니아어 독일어 콘텐츠를 식별하여, 지역어를 별도의 언어 자원으로 통합하거나 다루는 기회를 제시한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.