Skip to main content
QUICK REVIEW

[논문 리뷰] WeLM: A Well-Read Pre-trained Language Model for Chinese

Hui Su, Xiaofang Zhou|arXiv (Cornell University)|2022. 09. 21.
Topic Modeling인용 수 6
한 줄 요약

WeLM은 100억 파라미터의 디코더 전용 사전 훈련된 중국어 언어 모델로, 다양하고 고도로 정제된 코퍼스를 기반으로 훈련되어 단일 언어 및 다국어 작업 전반에서 뛰어난 제로샷 및 패기샷 일반화 성능을 달성한다. 유사한 크기의 모델보다 뛰어나며, 최대 25배 더 큰 모델과도 성능이 맞먹는다. 코드 스위칭 이해, 자기 설명, 자기 캘리브레이션 능력도 보여준다.

ABSTRACT

Large Language Models pre-trained with self-supervised learning have demonstrated impressive zero-shot generalization capabilities on a wide spectrum of tasks. In this work, we present WeLM: a well-read pre-trained language model for Chinese that is able to seamlessly perform different types of tasks with zero or few-shot demonstrations. WeLM is trained with 10B parameters by "reading" a curated high-quality corpus covering a wide range of topics. We show that WeLM is equipped with broad knowledge on various domains and languages. On 18 monolingual (Chinese) tasks, WeLM can significantly outperform existing pre-trained models with similar sizes and match the performance of models up to 25 times larger. WeLM also exhibits strong capabilities in multi-lingual and code-switching understanding, outperforming existing multilingual language models pre-trained on 30 languages. Furthermore, We collected human-written prompts for a large set of supervised datasets in Chinese and fine-tuned WeLM with multi-prompted training. The resulting model can attain strong generalization on unseen types of tasks and outperform the unsupervised WeLM in zero-shot learning. Finally, we demonstrate that WeLM has basic skills at explaining and calibrating the decisions from itself, which can be promising directions for future research. Our models can be applied from https://welm.weixin.qq.com/docs/api/.

연구 동기 및 목표

  • 작업 특화 미세조정 없이도 다양한 NLP 작업 전반에서 효과적으로 일반화되는 대규모이고 고도로 훈련된 중국어 언어 모델을 개발하는 것.
  • 고품질이고 다양한 훈련 코퍼스를 정제하고 모델 크기를 확장하여 중국어 NLP 작업에서 제로샷 및 패기샷 성능을 향상시키는 것.
  • 특히 중국어, 영어, 일본어를 포함한 다국어 환경에서의 격리된 언어 및 코드 스위칭 이해 능력을 강화하는 것.
  • 해당 대규모 언어 모델에서 자기 설명 및 자기 캘리브레이션 능력의 탐색과 구현을 통해 해석 가능성과 신뢰도를 향상시키는 것.
  • 다중 프롬프트 미세조정이 예측되지 않은 작업 유형 전반에서 제로샷 일반화에 미치는 영향을 탐구하는 것.

제안 방법

  • WeLM은 정제된 100억 파라미터 훈련 코퍼스를 기반으로 표준 좌측에서 우측으로의 언어 모델링 목적함수를 사용하여 디코더 전용 자동회귀 언어 모델로 훈련된다.
  • 훈련 코퍼스는 웹 텍스트, 학술 글쓰기, 다국어 콘텐츠 등 다양한 출처에서 정제되었으며, 데이터 출처 균형 조절 및 품질 필터링을 통해 광범위한 커버리지와 고품질을 확보한다.
  • WeLM은 대규모 감독형 중국어 NLP 데이터셋에서 수집한 인간이 작성한 프롬프트를 기반으로 다중 프롬프트 훈련을 통해 예측되지 않은 작업 유형에서의 제로샷 일반화 능력을 향상시킨다.
  • 자기 설명 및 자기 캘리브레이션 능력을 평가하기 위해, 모델이 자신의 예측에 대한 설명을 생성하고, 자신의 출력의 정확성과 독성 여부를 평가하도록 프롬프트를 제공한다.
  • 기억화를 측정하기 위해, 그리디 디코딩을 통해 원래 훈련 텍스트 세그먼트를 정확히 재생산할 수 있는 능력을 평가하고, 데이터 출처 및 토큰 빈도별로 기억화 비율을 분석한다.
  • WeLM의 성능을 18개의 단일 언어 중국어 작업, 다국어 작업(예: 번역, 질의응답), 코드 스위칭 벤치마크에서 기존 모델들과 비교한다.

실험 결과

연구 질문

  • RQ1중국어를 위한 대규모이고 정제된 사전 훈련된 언어 모델이 작업 특화 미세조정 없이도 다양한 NLP 작업 전반에서 뛰어난 제로샷 및 패기샷 일반화 성능를 달성할 수 있는가?
  • RQ2WeLM의 성능는 특히 중국어 NLP 벤치마크에서 제로샷 능력 측면에서 훨씬 더 큰 모델들과 비교해 어떻게 되는가?
  • RQ3WeLM은 중국어, 영어, 일본어를 포함한 다국어 및 코드 스위칭 상황에서 얼마나 잘 이해하고 생성할 수 있는가?
  • RQ4다중 프롬프트 미세조정은 예측되지 않은 작업 유형에서 제로샷 일반화 능력 향상에 기여하는가? 비미세조정된 사전 훈련된 WeLM 버전과 비교해보면 어떻게 되는가?
  • RQ5WeLM은 자신의 예측에 대한 설명을 생성하고, 잘못되거나 독성이 있는 출력을 탐지하는 등의 기본적인 자기 설명 및 자기 캘리브레이션 능력을 보여주는가?

주요 결과

  • WeLM은 18개의 단일 언어 중국어 NLP 작업에서 유사한 크기의 기존 사전 훈련 모델을 모두 앞서며, 25배 더 큰 모델인 Ernie 3.0 Titan의 성능과도 맞먹는다.
  • 기계 번역, 질의응답, 요약 등 다국어 작업에서 WeLM은 30개 언어로 사전 훈련된 다국어 모델인 XGLM을 능가한다.
  • WeLM은 강력한 코드 스위칭 이해 능력을 보이며, 중국어, 영어, 일본어가 혼합된 입력을 제로샷 방식으로 성공적으로 번역한다.
  • WeLM의 다중 프롬프트 미세조정은 예측되지 않은 작업 유형에서의 제로샷 일반화 능력을 향상시키며, 비미세조정된 WeLM 버전을 능가한다.
  • WeLM은 기본적인 자기 설명 및 자기 캘리브레이션 능력을 보이며, 설명 스타일을 모방하고 자신의 예측의 정확성과 독성을 정확히 판단할 수 있다.
  • 기억화 분석 결과, 더 큰 WeLM 모델일수록 더 많은 훈련 콘텐츠를 기억하며, 자주 등장하는 텍스트와 Common Crawl와 같은 높은 데이터 출처에서의 기억화 비율이 더 높다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.