Skip to main content
QUICK REVIEW

[논문 리뷰] Czert -- Czech BERT-like Model for Language Representation

Jakub Sido, Ondřej Pražák|arXiv (Cornell University)|2021. 03. 24.
Natural Language Processing Techniques참고 문헌 38인용 수 7
한 줄 요약

이 논문은 BERT 및 ALBERT 아키텍처를 기반으로 하며, 다양한 체코어 텍스트 36GB(다국어 모델 대비 50배 이상의 문장 수)를 사전 훈련한 첫 번째 체코어 전용 BERT 유사 언어 모델인 Czert를 소개한다. Czert-B 모델은 의미 유사도, 감성 분류, 명명된 실체 인식, 의미 역할 표기 등 11개의 NLP 과제 중 9개에서 최신 기준 성능을 기록하며, mBERT 및 SlavicBERT와 같은 다국어 모델을 능가한다. 연구 목적을 위해 공개된 사전 훈련 및 미세조정된 모델을 제공한다.

ABSTRACT

This paper describes the training process of the first Czech monolingual language representation models based on BERT and ALBERT architectures. We pre-train our models on more than 340K of sentences, which is 50 times more than multilingual models that include Czech data. We outperform the multilingual models on 9 out of 11 datasets. In addition, we establish the new state-of-the-art results on nine datasets. At the end, we discuss properties of monolingual and multilingual models based upon our results. We publish all the pre-trained and fine-tuned models freely for the research community.

연구 동기 및 목표

  • 체코어 전용 고성능의 단일 언어 BERT 유사 언어 모델을 개발하여 다국어 모델의 한계를 극복한다.
  • 다국어 모델보다 훨씬 큰 체코어 전용 코퍼스(36GB, 34만 개 이상의 문장)를 사용해 사전 훈련함으로써 언어 표현 능력을 향상시킨다.
  • 의미적 텍스트 유사도, 명명된 실체 인식, 감성 분류 등 체코어 NLP 핵심 과제에서 최신 기준 성능을 확립한다.
  • 체코어 NLP 커뮤니티를 위해 완전히 훈련된, 즉시 사용 가능한 사전 훈련 및 미세조정된 모델을 공개한다.

제안 방법

  • 위키피디아, 뉴스, 체코 국립 코퍼스를 조합한 36GB의 체코어 텍스트 코퍼스에서 랜덤 초기화로부터 Czert-B(BERT 기반) 및 Czert-A(ALBERT 기반) 모델을 사전 훈련한다.
  • 표준 마스킹 언어 모델링(MLM) 목적과 수정된 다음 문장 예측(NSP) 작업을 사전 훈련 목적으로 사용한다.
  • 의미적 텍스트 유사도(STS), 명명된 실체 인식(NER), 형태소 태깅(MoT), 의미 역할 표기(SRL), 감성 분류(SC), 다중 레이블 문서 분류(MLC) 등 6개의 하류 NLP 과제에서 사전 훈련된 모델을 미세조정한다.
  • 이 과제들에 걸쳐 11개 데이터셋에서 성능을 평가하고, mBERT 및 SlavicBERT와 같은 다국어 모델과 비교한다.
  • 표준 BERT/ALBERT 아키텍처를 사용하며, 12층, 768개의 은닉 차원(Czert-B), 12개의 어텐션 헤드를 사용하고, Czert-A에서는 파라미터 수를 줄이기 위해 가중치 공유를 적용한다.
  • STS 과제 평가에 10겹 교차 검증을 적용하고, 95% 신뢰구간을 포함한 평균 성능을 보고한다.

실험 결과

연구 질문

  • RQ1큰 규모의 다양한 체코어 코퍼스에서 사전 훈련된 단일 언어 BERT 유사 모델이 기존 다국어 모델보다 체코어 NLP 과제에서 더 뛰어난 성능을 보일 수 있는가?
  • RQ2mBERT 및 SlavicBERT와 같은 다국어 모델과 비교했을 때 체코어 전용 모델의 성능은 다양한 NLP 벤치마크에서 어떻게 다른가?
  • RQ3사전 훈련 코퍼스 크기를 50배 증가시킴으로써 체코어 NLP의 하류 과제 성능이 얼마나 향상되는가?
  • RQ4Czert-B 모델이 의미적 텍스트 유사도 및 명명된 실체 인식과 같은 핵심 체코어 NLP 과제에서 최신 기준 성능을 달성하는가?

주요 결과

  • Czert-B는 평가된 11개 데이터셋 중 9개에서 mBERT 및 SlavicBERT를 능가하며, 9개 데이터셋에서 새로운 최신 기준 성능을 확립했다.
  • STS 과제에서 Czert-B는 피어슨 상관계수 89.29±0.17을 기록하여 mBERT(87.88±0.08) 및 SlavicBERT(88.97±0.09)를 뛰어넘는 성능을 보였다.
  • 감성 분류(SC) 과제에서 Czert-B는 CNA 데이터셋에서 F1 점수 83.74±0.40을 기록하여 이전 최신 기준 대비 5% 향상된 성능을 보였다.
  • CNEC 데이터셋을 사용한 NER 과제에서 Czert-B는 F1 점수 86.27을 기록하여 이전 최신 기준 대비 5% 향상되었고, SlavicBERT를 초월했다.
  • CoNLL-09 SRL 데이터셋에서 Czert-B는 F1 점수 99.410을 기록하여 새로운 최신 기준을 수립했으며, mBERT(99.301) 및 SlavicBERT(99.211)를 모두 능가했다.
  • 다국어 기준 모델 대비 더 안정적이고 강력한 훈련 성능을 보였으며, 특히 소규모 데이터셋에서 과적합 현상이 감소했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.