Skip to main content
QUICK REVIEW

[논문 리뷰] German's Next Language Model

Branden Chan, Stefan Schweter|arXiv (Cornell University)|2020. 10. 21.
Topic Modeling참고 문헌 22인용 수 9
한 줄 요약

이 논문은 평가 기반 접근 방식을 통해 사전 훈련 중 정기적인 다운스트림 평가를 통해 성능이 가장 우수한 체크포인트를 선택함으로써, 독일어 BERT 및 ELECTRA 언어 모델인 GBERT와 GELECTRA를 제시한다. 이 모델들은 GermEval18 및 GermEval14에서 새로운 SoTA 성능을 기록하였으며, GELECTRA Large는 NER에서 +4.3% F1 향상과 함께 혐오 발언 탐지에서 +2.45% 향상된 성능을 보였다. 또한, 더 많은 훈련 데이터와 Whole Word Masking(WWM)이 성능 향상에 크게 기여함을 입증하였다.

ABSTRACT

In this work we present the experiments which lead to the creation of our BERT and ELECTRA based German language models, GBERT and GELECTRA. By varying the input training data, model size, and the presence of Whole Word Masking (WWM) we were able to attain SoTA performance across a set of document classification and named entity recognition (NER) tasks for both models of base and large size. We adopt an evaluation driven approach in training these models and our results indicate that both adding more data and utilizing WWM improve model performance. By benchmarking against existing German models, we show that these models are the best German models to date. Our trained models will be made publicly available to the research community.

연구 동기 및 목표

  • 다운스트림 태스크 성능 기반으로 최적의 체크포인트를 선택하는 평가 기반 사전 훈련 전략을 활용하여 고성능 독일어 언어 모델을 개발한다.
  • 훈련 데이터 볼륨, 모델 크기, Whole Word Masking(WWM)이 독일어 BERT 및 ELECTRA 모델에 미치는 영향을 조사한다.
  • 문서 분류 및 명명된 실체 인식(NER)을 포함한 독일어 NLP 벤치마크에서 새로운 SoTA 성능을 확립한다.
  • 연구 공동체에 공개 가능한 고품질의 독일어 언어 모델을 제공한다.

제안 방법

  • 평가 기반 사전 훈련 전략을 사용하여, 모델을 정기적으로 체크포인트로 저장하고 다운스트림 분류 및 NER 태스크에서 평가하여 성능이 가장 뛰어난 모델을 선별하였다.
  • 입력 데이터(예: OSCAR, Common Crawl), 모델 크기(베이스 및 라지), Whole Word Masking(WWM)의 포함 여부를 변화시켜 여러 훈련 제도를 테스트하였다.
  • BERT 기반 모델의 경우, 마스킹된 언어 모델링(MLM)을 사용하였으며, WWM은 단어의 모든 서브워드 토큰이 함께 마스킹되도록 보장하였다.
  • ELECTRA 기반 모델의 경우, 대체 토큰 탐지 사전 훈련 작업을 적용하였으며, 생성기(generator)가 타당한 토큰 대체물을 생성하고, 구분기(discriminator)가 각 토큰이 진짜인지 대체되었는지를 분류하였다.
  • 모델들은 GermEval18(혐오 발언 탐지) 및 GermEval14(NER) 등의 다운스트림 태스크에서 파인튜닝되었으며, 성능은 F1 및 정확도로 측정되었다.
  • 훈련은 TPU 풀과 EC2 인스턴스를 사용하여 수행되었으며, 모델 선택은 평가 태스크에서 가장 높은 성능을 기록한 모델을 기반으로 이루어졌다.

실험 결과

연구 질문

  • RQ1훈련 데이터 볼륨을 늘리면 독일어 BERT 및 ELECTRA 모델의 성능 향상에 상당한 기여를 하는가?
  • RQ2기본 마스킹 방식과 비교해 Whole Word Masking(WWM)이 독일어 BERT 모델의 성능에 미치는 영향은 무엇인가?
  • RQ3더 효율적인 사전 훈련 덕분에 ELECTRA 기반 모델이 더 적은 훈련 토큰 수로도 BERT 기반 모델보다 뛰어난 성능을 낼 수 있는가?
  • RQ4모델 크기(베이스 대 라지)가 독일어 NLP 태스크의 다운스트림 성능에 미치는 영향은 무엇인가?
  • RQ5평가 기반 사전 훈련 전략이 최종 모델 성능 측면에서 표준 고정 단계 훈련 방식을 능가할 수 있는가?

주요 결과

  • GELECTRA Large는 GermEval14 NER 태스크에서 기존 최고 성능보다 +4.3% 향상된 새로운 SoTA F1 점수 88.95를 기록하였다.
  • GermEval18 혐오 발언 탐지 태스크에서 GELECTRA Large는 세분화된 변형에서 이전 SoTA보다 +2.45% 향상되었으며, 개괄적 변형에서는 +3.93% 향상되었다.
  • GBERT Data + WWM은 세 개의 NLP 태스크 평균 F1에서 DBMDZ BERT Base보다 +2.18% 높은 성능을 보였다.
  • GELECTRA Large는 더 작은 배치 크기로 인해 토큰 수가 절반 이하로 줄었음에도 불구하고, GBERT Large보다 평균 F1에서 +1.47% 높은 성능을 기록하였다.
  • Whole Word Masking는 항상 BERT 기반 모델의 성능 향상에 기여하였으며, GBERT WWM은 DBMDZ BERT Base보다 +1.25% F1 높았고, GBERT Data + WWM은 GBERT Data보다 +2.38% F1 향상되었다.
  • 더 많은 훈련 데이터 추가로 성능 향상이 측정되었으며, GELECTRA Data는 GELECTRA보다 +1.59% F1 높았고, GBERT Data + WWM은 GBERT Data보다 +0.93% F1 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.