[논문 리뷰] CLUECorpus2020: A Large-scale Chinese Corpus for Pre-training Language Model
CLUECorpus2020을 도입, pre-training 언어 모델을 위한 100 GB 규모의 중국어 원시 코퍼스와 компакт한 어휘 및 pretrained 모델을 제공; 중국어 NLP 벤치마크에서 강력한 성능과 효율성 향상을 입증합니다.
In this paper, we introduce the Chinese corpus from CLUE organization, CLUECorpus2020, a large-scale corpus that can be used directly for self-supervised learning such as pre-training of a language model, or language generation. It has 100G raw corpus with 35 billion Chinese characters, which is retrieved from Common Crawl. To better understand this corpus, we conduct language understanding experiments on both small and large scale, and results show that the models trained on this corpus can achieve excellent performance on Chinese. We release a new Chinese vocabulary with a size of 8K, which is only one-third of the vocabulary size used in Chinese Bert released by Google. It saves computational cost and memory while works as good as original vocabulary. We also release both large and tiny versions of the pre-trained model on this corpus. The former achieves the state-of-the-art result, and the latter retains most precision while accelerating training and prediction speed for eight times compared to Bert-base. To facilitate future work on self-supervised learning on Chinese, we release our dataset, new vocabulary, codes, and pre-trained models on Github.
연구 동기 및 목표
- Pre-training 언어 모델 및 생성에 적합한 대규모의 고품질 중국어 비라벨 데이터 코퍼스를 제공한다.
- 다양한 데이터 크기와 어휘를 사용할 때 CLUECorpus2020에서의 훈련이 중국어 NLP 태스크 성능에 어떤 영향을 미치는지 평가한다.
- compact Chinese vocabulary (vocab_clue)를 제안하고 대형 및 초소형 pretrained 모델을 가능하게 하여 효율적 학습과 추론을 지원한다.
- pre-trained 모델을 사용한 관련 중국어 NLP 태스크 간 전이 학습의 잠재적 이점을 Demonstrate한다.
제안 방법
- Common Crawl에서 중국어 품질을 위한 필터링 규칙과 중복 제거를 적용한 100 GB 중국어 코퍼스를 구성한다.
- 라인당 한 문장 형식(문서당 빈 행 1개)으로 pre-training-ready 포맷을 정의하고 train/dev/test 스플릿을 대략 99:0.5:0.5로 선택한다.
- 중복 토큰 제거 및 중국어/영어 토큰화 맞춤화를 통해 8K 크기의 compact vocabulary (vocab_clue)를 생성한다.
- CLUECorpus2020에서 여러 BERT-스타일 모델을 학습시키고 Google의 vocab 및 Wiki/C5 벤치마크를 CLUE 벤치마크 태스크와 비교한다.
- 주의 메커니즘(예: minus-and-multiplication 변형)과 대형/초소형 pretrained 모델 간의 실험으로 효율성과 정확도를 평가한다.
- 데이터 규모를 1 GB, 3 GB, 100 GB로 달리하고 학습 단계수를 조정하여 baselines와의 성능 차이를 비교한다.
실험 결과
연구 질문
- RQ1CLUECorpus2020에서의 사전 학습이 표준 벤치마크에서 중국어 이해도에 어떤 영향을 미치는가?
- RQ2제안된 vocab_clue와 Google의 원래 어휘를 사용하는 경우 다운스트림 태스크에 어떤 차이가 나타나는가?
- RQ3사전 학습 데이터 크기 및 학습 단계 수를 늘리는 것이 모델 성능에 어떤 영향을 주는가?
- RQ4compact하고 효율적인 모델(초소형 변형)이 상당한 속도 향상에도 불구하고 경쟁력 있는 성능을 달성할 수 있는가?
- RQ5관련 중국어 태스크 간의 전이 학습이 문장-쌍 태스크의 성능을 향상시키는가?
주요 결과
- CLUECorpus2020에서 학습된 모델은 데이터세트에 대해 완전 학습 시 중국어 벤치마크에서 경쟁력 있는 또는 최첨단 결과를 달성한다.
- 8K 어휘(vocab_clue)가 더 큰 어휘와 비슷한 다운스트림 성능을 제공하면서 매개변수를 줄이고 학습 속도를 높인다.
- CLUE 어휘는 Google의 어휘에 비해 더 작은 모델 크기로 약 15.4%의 학습 속도 향상을 가능하게 한다.
- 학습 데이터 규모를 1 GB에서 3 GB 이상으로 늘리면 일반적으로 태스크 전반의 성능이 향상된다.
- RoBERTa-tiny-clue 같은 초소형 변형은 대부분의 정밀도를 유지하면서 추론/학습 속도를 크게 높여 BERT-base 대비 최대 약 8배 빠를 수 있다.
- 관련 태스크 간의 전이 학습(예: CMNLI에서 AFQMC)은 문장-쌍 태스크의 성능을 향상시킬 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.