Skip to main content
QUICK REVIEW

[논문 리뷰] CPM-2: Large-scale Cost-effective Pre-trained Language Models

Zhengyan Zhang, Yuxian Gu|arXiv (Cornell University)|2021. 06. 20.
Natural Language Processing Techniques인용 수 15
한 줄 요약

CPM-2는 지식 유산을 활용해 사전 훈련을 가속화하고, 프롬프트 테이닝을 통해 미세조정 저장소를 줄이며, InfMoE—동적 오프로딩 추론 툴킷—을 통해 MoE 모델의 효율적인 단일 GPU 추론을 가능하게 하는 비용 효율적인 파이프라인을 도입한다. 이 프레임워크는 이중어(중국어-영어) 11B 파라미터 모델과 198B 파라미터 MoE 버전을 제공하며, 일반 언어 이해 과제에서 mT5를 능가하면서도 계산 및 저장 비용을 크게 감소시킨다.

ABSTRACT

In recent years, the size of pre-trained language models (PLMs) has grown by leaps and bounds. However, efficiency issues of these large-scale PLMs limit their utilization in real-world scenarios. We present a suite of cost-effective techniques for the use of PLMs to deal with the efficiency issues of pre-training, fine-tuning, and inference. (1) We introduce knowledge inheritance to accelerate the pre-training process by exploiting existing PLMs instead of training models from scratch. (2) We explore the best practice of prompt tuning with large-scale PLMs. Compared with conventional fine-tuning, prompt tuning significantly reduces the number of task-specific parameters. (3) We implement a new inference toolkit, namely InfMoE, for using large-scale PLMs with limited computational resources. Based on our cost-effective pipeline, we pre-train two models: an encoder-decoder bilingual model with 11 billion parameters (CPM-2) and its corresponding MoE version with 198 billion parameters. In our experiments, we compare CPM-2 with mT5 on downstream tasks. Experimental results show that CPM-2 has excellent general language intelligence. Moreover, we validate the efficiency of InfMoE when conducting inference of large-scale models having tens of billions of parameters on a single GPU. All source code and model parameters are available at https://github.com/TsinghuaAI/CPM.

연구 동기 및 목표

  • 대규모 사전 훈련 언어 모델(PLM)을 훈련하고 배포함에 있어 발생하는 높은 계산, 저장, 추론 비용 문제를 해결하기 위함.
  • 기존 PLM에서 유래한 지식을 재사용함으로써 지식 유산을 통해 사전 훈련을 가속화하기 위함.
  • 기존의 전체 미세조정 대신 프롬프트 테이닝을 적용하여, 작업별 파라미터를 전체 모델의 0.01% 미만으로 줄여 저장 비용을 감소시키기 위함.
  • 새로운 동적 오프로딩 프레임워크인 InfMoE를 통해 제한된 하드웨어 환경에서도 대규모 MoE 모델의 효율적인 추론을 가능하게 하기 위함.
  • 이중어(중국어-영어) 과제를 위한 높은 성능과 비용 효율성을 갖춘 두 가지 PLM, 즉 CPM-2(11B 파라미터)와 CPM-2-MoE(198B 파라미터)를 개발하기 위함.

제안 방법

  • 지식 유산은 사전 훈련 중에 기존에 훈련된 PLM의 가중치로 새로운 모델를 초기화함으로써 적용되며, 단계별로 나뉘어진다: 중국어 사전 훈련, 이중어 사전 훈련, MoE 사전 훈련.
  • 전체 미세조정 대신 프롬프트 테이닝을 사용하여, 학습 가능한 프롬프트 임베딩만 업데이트되며, 이로 인해 작업별 파라미터가 전체 모델의 0.01% 미만으로 줄어든다.
  • InfMoE는 고성능이며 메모리 효율적인 추론 프레임워크로, 동적 스케줄링을 통해 파라미터 이동과 계산을 겹치며, 십억 수준의 파라미터를 가진 모델에 대해 단일 GPU에서 추론을 가능하게 한다.
  • 모델 아키텍처는 마스크된 언어 모델링 목표를 갖춘 하이브리드 인코더-디코더 트랜스포머이며, 스파니드 예측에 최적화되어 있으며, 스팬은 특수 토큰으로 대체되고 디코더에 의해 예측된다.
  • MoE 버전은 토큰을 희소 전문가에게 라우팅하기 위한 게이팅 메커니즘을 사용하며, 평가 중 전문가 사용이 균형을 이루는 것으로 관찰되어 효율적인 확장이 가능하다.
  • 토크나이제이션은 발음 기반 및 문자형 기반 방법을 사용하여 향상되었으며, 중국어 NLP 과제에서 문자 기반 토크나이제이션보다 강건성과 성능 면에서 뛰어나다.

실험 결과

연구 질문

  • RQ1기존 모델을 활용해 지식 유산을 적용함으로써 대규모 PLM의 사전 훈련에 소요되는 시간과 계산 비용을 크게 줄일 수 있는가?
  • RQ2전체 미세조정 대비 프롬프트 테이닝이 저장 비용을 줄이는 데 얼마나 효과적인가, 동시에 하류 작업 성능을 유지하거나 향상시키는가?
  • RQ3InfMoE와 같은 동적 오프로딩 추론 프레임워크는 십억 수준의 파라미터를 가진 대규모 MoE 모델에 대해 단일 GPU에서 효율적인 추론을 가능하게 하는가?
  • RQ4대규모 PLM에서 프롬프트의 최적의 배치와 구조는 하류 작업 성능을 극대화하기 위해 어떻게 설정되어야 하는가?
  • RQ5비유클리드 아키텍처인 투두형 트랜스포머는 더 적은 파라미터로도 효율성과 성능을 향상시킬 수 있는가?

주요 결과

  • CPM-2는 최신 기술 수준의 일반 언어 지능을 달성하여, 하류 작업에서 일곱 가지 특정 언어 능력에 걸쳐 강력한 성능을 보이며 mT5를 능가한다.
  • 최적화된 프롬프트 위치와 하이브리드 프롬프트-미세조정 전략을 통한 프롬프트 테이닝은 각각 단독으로 사용할 때보다 더 높은 성능을 달성한다.
  • InfMoE는 CPM-2-MoE(198B 파라미터)를 단일 GPU에서 효율적으로 추론할 수 있도록 하며, 계산 시간과 파라미터 이동을 겹치면서 지연 시간을 감소시킨다.
  • 지식 유산은 존재하는 PLM에서 초기화함으로써 사전 훈련 시간과 비용을 줄이며, 중국어, 이중어, MoE 데이터에 대한 단계적 사전 훈련을 통해 훈련을 가속화한다.
  • 발음 기반 및 문자형 기반 토크나이제이션 방법은 중국어 NLP 과제에서 문자 기반 토크나이제이션보다 강건성과 성능 면에서 뛰어나다.
  • 투두형 트랜스포머 프레임워크는 반의 수준의 파라미터로 유클리드 트랜스포머와 유사한 성능을 달성하여, 향후 더 효율적인 PLM 아키텍처 개발 잠재력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.