Skip to main content
QUICK REVIEW

[논문 리뷰] FinEst BERT and CroSloEngual BERT: less is more in multilingual models

Matej Ulčar, Marko Robnik‐Šikonja|arXiv (Cornell University)|2020. 06. 14.
Topic Modeling참고 문헌 12인용 수 6
한 줄 요약

이 논문은 핀란드어, 에스토니아어, 영어 및 크로아티아어, 슬로베니아어, 영어를 각각 대상으로 하는 FinEst BERT와 CroSloEngual BERT—삼중어 BERT 기반 모델을 소개한다. 영어를 포함한 세 개의 언어에 초점을 맞춰 교차 언어 전이를 가능하게 하여, 단말어 및 교차 언어 설정에서 NER, POS 태깅, 의존성 파싱 작업에서 mBERT 및 XLM-R를 능가하는 뛰어난 성능을 달성함으로써, 더 작은 규모이지만 목표에 맞춘 다국어 모델이 더 넓은 다국어 모델보다 우수하다는 것을 입증한다.

ABSTRACT

Large pretrained masked language models have become state-of-the-art solutions for many NLP problems. The research has been mostly focused on English language, though. While massively multilingual models exist, studies have shown that monolingual models produce much better results. We train two trilingual BERT-like models, one for Finnish, Estonian, and English, the other for Croatian, Slovenian, and English. We evaluate their performance on several downstream tasks, NER, POS-tagging, and dependency parsing, using the multilingual BERT and XLM-R as baselines. The newly created FinEst BERT and CroSloEngual BERT improve the results on all tasks in most monolingual and cross-lingual situations

연구 동기 및 목표

  • 특정한 다국어 BERT 모델을 훈련시켜 자원이 부족한 언어의 NLP 작업 성능을 향상시키기 위해, 밀접하게 관련된 언어 쌍을 위한 전문화된 다국어 BERT 모델을 개발한다.
  • 다국어 BERT 모델의 언어 수를 줄임으로써 자원이 부족한 언어에 대한 성능 향상 여부를 조사한다.
  • 삼중어 모델에서 영어를 다국어 이동의 다리 역할로 포함시켜 효과적인 교차 언어 전이를 가능하게 한다.
  • 핀란드어, 에스토니아어, 크로아티아어, 슬로베니아어를 위한 공개 가능하고 고품질의 다국어 모델을 구축한다.
  • 단말어 및 교차 언어 설정에서 NER, POS 태깅, 의존성 파싱과 같은 하류 작업에서 모델 성능을 평가한다.

제안 방법

  • 목표 언어 각각의 정제된, 중복 제거된 단일어 문장집합을 기반으로, 12층, 768개의 은닉 크기, 110M 매개변수를 가진 BERT-base 모델을 훈련시켰다.
  • 각 언어의 균형 잡힌 서브워드(WordPiece) 어휘를 구성하기 위해, 예를 들어 FinEst에서 에스토니아어에 대해 7500만 토큰, CroSloEngual에서 슬로베니아어에 대해 2800만 토큰을 사용했다.
  • 문장 및 문단 수준에서 9-그램과 0.9 임계값을 사용하여 Onion 중복 제거 도구를 적용해 중복을 줄였다.
  • 전체 단어 마스킹과 케이스를 유지하는 토크나이제이션을 적용하여 언어적 차이를 유지했다.
  • Devlin 등(2019)의 초모수를 기반으로, 시퀀스 길이 128로 약 40 에포크 동안 훈련한 후, 더 긴 시퀀스로 약 4 에포크 추가 훈련을 수행했다.
  • mBERT 및 XLM-R 기준 모델을 NER, POS 태깅, 의존성 파싱 작업에서 평가하여, UPOS 정확도, UAS, LAS 점수를 측정했다.

실험 결과

연구 질문

  • RQ1두 개의 밀접하게 관련된 자원이 부족한 언어와 영어를 포함한 삼중어 BERT 모델이, mBERT와 같은 더 큰 다국어 모델보다 하류 NLP 작업에서 성능을 뛰어나게 할 수 있는가?
  • RQ2다국어 BERT 모델의 언어 수를 줄임으로써 자원이 부족한 언어에 대한 언어 표현의 향상으로 인해 성능 향상이 이루어지는가?
  • RQ3유사한 자원이 부족한 언어를 위한 삼중어 모델에서 영어를 다리 역할로 포함시킴으로써 교차 언어 전이가 얼마나 향상될 수 있는가?
  • RQ4FinEst BERT와 CroSloEngual BERT는 단말어 및 교차 언어 설정에서 NER, POS 태깅, 의존성 파싱 작업에서 mBERT와 어떻게 비교되는가?
  • RQ5특히 영어를 포함시켜 전이 학습을 지원하기 위해 더 적은 언어로 훈련할 경우 성능의 상충 관계가 발생하는가?

주요 결과

  • FinEst BERT는 핀란드어 및 에스토니아어의 모든 NER 작업에서 mBERT를 능가했으며, 단말어 설정에서 핀란드어에 대해 1.1% 향상되고 에스토니아어에 대해 0.6% 향상되었다.
  • CroSloEngual BERT는 단말어 평가에서 슬로베니아어 NER에 대해 0.4% 향상되고 크로아티아어 NER에 대해 0.8% 향상되었다.
  • POS 태깅에서 FinEst BERT는 핀란드어에 대해 mBERT 대비 2.6% 향상되었고, 에스토니아어에 대해서도 2.6% 향상되었으며, 핀란드어에서 훈련한 경우 영어에 대해 1.2% 향상되었다.
  • 의존성 파싱에서 FinEst BERT는 핀란드어에 대해 mBERT 대비 3.5% 더 높은 LAS를 기록했고, 에스토니아어에 대해서는 2.9% 향상되었으며, 핀란드어에서 훈련한 경우 영어에 대해 4.3% 향상되었다.
  • CroSloEngual BERT는 슬로베니아어에 대해 mBERT 대비 2.5% LAS 향상되었고, 크로아티아어에 대해서는 1.9% 향상되었으며, 슬로베니아어에서 훈련한 경우 영어에 대해 4.6% 향상되었다.
  • mBERT는 의존성 파싱에서 영어로 훈련하고 크로아티아어로 테스트할 경우에만 CroSloEngual BERT를 능가했으며, 이는 언어에 따라 성능 격차가 존재함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.