[논문 리뷰] Building a Large Japanese Web Corpus for Large Language Models
이 논문은 2020–2023년 동안의 21개의 Common Crawl 스냅샷에서 추출·정제한 3121억 글자(17300만 페이지)의 대규모 고품질 일본어 웹 코퍼스를 제시한다. 언어별로 특화된 정제 및 중복 제거 기법을 적용함으로써, Llama 2 13B 및 Mixtral 8x7B Instruct를 포함한 다양한 LLM에서 일본어 벤치마크 성능에 6.6–8.1점의 일관된 향상을 이룬다.
Open Japanese large language models (LLMs) have been trained on the Japanese portions of corpora such as CC-100, mC4, and OSCAR. However, these corpora were not created for the quality of Japanese texts. This study builds a large Japanese web corpus by extracting and refining text from the Common Crawl archive (21 snapshots of approximately 63.4 billion pages crawled between 2020 and 2023). This corpus consists of approximately 312.1 billion characters (approximately 173 million pages), which is the largest of all available training corpora for Japanese LLMs, surpassing CC-100 (approximately 25.8 billion characters), mC4 (approximately 239.7 billion characters) and OSCAR 23.10 (approximately 74 billion characters). To confirm the quality of the corpus, we performed continual pre-training on Llama 2 7B, 13B, 70B, Mistral 7B v0.1, and Mixtral 8x7B Instruct as base LLMs and gained consistent (6.6-8.1 points) improvements on Japanese benchmark datasets. We also demonstrate that the improvement on Llama 2 13B brought from the presented corpus was the largest among those from other existing corpora.
연구 동기 및 목표
- 다국어 코퍼스에서 유래하는 경향이 있는 오픈소스 LLM에 대한 고품질 일본어 전용 학습 데이터의 부족을 해결한다. 이는 종종 일본어 품질이 열악한 다국어 코퍼스에서 유래한다.
- 원시 Common Crawl 데이터에서 대규모 고 fidelity 일본어 웹 코퍼스를 구축하여 일본어 LLM의 효과적인 사전학습을 지원한다.
- 다양한 기본 LLM에 대한 연속적 사전학습을 통해 코퍼스의 효과성을 입증하고, 일본어 벤치마크에서 일관된 성능 향상을 입증한다.
- 재현 가능하고 공개된 코퍼스 및 미세조정된 모델을 제공하여 향후 일본어 NLP 및 책임감 있는 LLM 개발 연구를 지원한다.
제안 방법
- Trafilatura를 사용하여 2020–2023년 동안의 21개의 Common Crawl 스냅샷에서 원시 텍스트를 추출하였으며, 총 약 634억 페이지에 달한다.
- Jaccard 계수 임계값 약 0.9를 사용한 MinHash 기반 중복 제거를 통해 문자 5-그램 수준에서 근접한 중복 콘텐츠를 제거한다.
- 일본어에 특화된 품질 필터를 구현하여 과도한 반복, 이모티콘 밀도, 기능어 부족 등의 저품질 콘텐츠를 탐지하고 제거한다.
- 사용자 정의 일본어 텍스트 품질 평가기법을 사용하여 낮은 가능성 또는 손상된 텍스트를 필터링함으로써 전체 코퍼스의 일관성과 유용성을 향상시킨다.
- 정제된 코퍼스를 사용하여 다섯 가지 기본 LLM(Llama 2 7B, 13B, 70B; Mistral 7B v0.1; Mixtral 8x7B Instruct)에 대해 연속적 사전학습을 수행한다.
- 표준 일본어 벤치마크 데이터셋에서의 성능 평가를 통해 다운스트림 NLP 작업에서의 향상 정도를 정량화한다.

실험 결과
연구 질문
- RQ1원시 Common Crawl 데이터에서 언어별 정제 및 중복 제거 기법을 적용하여 대규모 고품질 일본어 웹 코퍼스를 효과적으로 구축할 수 있는가?
- RQ2제안된 코퍼스에서의 연속적 사전학습이 다양한 LLM 아키텍처에 걸쳐 일본어 NLP 벤치마크 성능에 얼마나 기여하는가?
- RQ3기존 코퍼스인 mC4, CC-100, OSCAR와 비교해 제안된 코퍼스의 일본어 작업 성능 향상 정도는 어떠한가?
- RQ4정제된 일본어 코퍼스의 포함이 일본어-영어 번역과 같은 다국어 작업 성능에 악영향을 미치는가?
- RQ5이 코퍼스를 사용해 LLM을 처음부터 훈련시킬 수 있으며, 이는 모델 일반화 및 안전성에 어떤 영향을 미치는가?
주요 결과
- 제안된 코퍼스는 3121억 글자(17300만 페이지)를 포함하고 있으며, mC4(2397억), CC-100(258억), OSCAR(740억)를 능가하는 일본어 LLM 학습을 위한 가장 큰 가용 코퍼스이다.
- 코퍼스에서의 연속적 사전학습으로 다수의 일본어 벤치마크 데이터셋에서 6.6–8.1점의 일관된 성능 향상이 이루어졌으며, Llama 2 13B가 비교된 모든 코퍼스 중에서 가장 큰 향상을 보였다.
- 모델 크기(7B, 13B, 8x7B, 70B)에 관계없이 모든 평가된 모델 크기에서 최고 성능을 달성하여 코퍼스의 다양한 모델 스케일에 대한 효과성을 입증했다.
- Llama 2 13B의 성능 향상은 기존의 어떤 코퍼스보다도 크며, 이는 일본어 NLP에 대해 코퍼스의 뛰어난 품질과 관련성의 증거이다.
- 영어-일본어 번역 성능은 향상되었지만, 반대로 일본어-영어 번역 성능은 약간 떨어졌으며, 이는 균형 잡힌 데이터 코어처이 필요함을 시사한다.
- 모든 미세조정된 모델 및 벤치마크 데이터셋은 Hugging Face에 공개되어 있어 실험 결과의 완전한 재현 가능성을 보장한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.