Skip to main content
QUICK REVIEW

[논문 리뷰] A Warm Start and a Clean Crawled Corpus -- A Recipe for Good Language Models

Vésteinn Snæbjarnarson, Haukur Barri Símonarson|arXiv (Cornell University)|2022. 01. 14.
Natural Language Processing Techniques인용 수 10
한 줄 요약

이 논문은 정제된 크롤링된 단일어 문장어 코퍼스(IC3)와 정제된 아이슬란드어 Gigaword 코퍼스를 기반으로 훈련된 아이슬란드어를 위한 최신 기술 기반의 언어 모델인 IceBERT를 제시한다. 다국어 모델에서의 온기 시작(warm start) 전략과 고품질의 도메인 중심 웹 데이터를 활용함으로써, 품사 태깅, NER, 문법 오류 탐지, 구문 분석 등 다양한 과제에서 최고 성능(SOTA)을 달성하였다. 이는 정제된 대규모 크롤링 데이터가 자원이 적거나 중간 수준의 언어에서 정제된 코퍼스에 맞먹을 수 있음을 보여준다.

ABSTRACT

We train several language models for Icelandic, including IceBERT, that achieve state-of-the-art performance in a variety of downstream tasks, including part-of-speech tagging, named entity recognition, grammatical error detection and constituency parsing. To train the models we introduce a new corpus of Icelandic text, the Icelandic Common Crawl Corpus (IC3), a collection of high quality texts found online by targeting the Icelandic top-level-domain (TLD). Several other public data sources are also collected for a total of 16GB of Icelandic text. To enhance the evaluation of model performance and to raise the bar in baselines for Icelandic, we translate and adapt the WinoGrande dataset for co-reference resolution. Through these efforts we demonstrate that a properly cleaned crawled corpus is sufficient to achieve state-of-the-art results in NLP applications for low to medium resource languages, by comparison with models trained on a curated corpus. We further show that initializing models using existing multilingual models can lead to state-of-the-art results for some downstream tasks.

연구 동기 및 목표

  • 제한된 언어 자원을 바탕으로 아이슬란드어 자연어 처리 성능을 향상시키기 위해 고성능 언어 모델을 개발하는 것.
  • 정제된 웹 크롤링 코퍼스가 자원이 적은 환경에서 정제된 단일어 문장어 코퍼스와 경쟁하거나 승리할 수 있는지 평가하는 것.
  • 다국어 미사전훈련된 가중치로 모델을 초기화하는 것(온기 시작)이 아이슬란드어 NLP 과제에 대해 성능 향상에 기여하는지 조사하는 것.
  • 저자원 언어를 위한 웹에서 고품질 언어 데이터를 추출하고 정제하는 재현 가능한 방법을 수립하는 것.
  • 수동으로 번역하고 적응시킨 아이슬란드어 버전의 WinoGrande 공통이성 추론 데이터셋을 제작하여 평가 기준을 높이는 것.

제안 방법

  • 도메인 타겟팅 및 언어적 관련성 필터링을 통해 .is 고위 도메인을 대상으로 하여 16GB의 아이슬란드어 텍스트로 구성된 고품질 코퍼스인 아이슬란드 커먼 캐스트 코퍼스(IC3)를 구축하였다.
  • 추가로 공개된 아이슬란드어 텍스트 자료를 수집하고 통합하여 총 27억 토큰의 포괄적인 단일어 문장어 훈련 코퍼스를 구성하였다.
  • IC3 코퍼스에서 아이슬란드어에 맞게 사전 훈련된 다국어 모델(예: XLM-R-base)을 계속해서 훈련함으로써 온기 시작 전략을 적용하였다.
  • 웹 크롤링 텍스트에서 불필요한 내용, 중복 및 저품질 콘텐츠를 제거하기 위한 신규 데이터 정제 파이프라인을 구현하였다.
  • 정제된 단일어 문장어 데이터에서 표준 BERT 스타일의 사전 훈련을 통해 여러 개의 트랜스포머 기반 언어 모델, 포함 IceBERT를 훈련시켰다.
  • 수동 번역 및 언어학적 적응을 통해 WinoGrande 데이터셋을 아이슬란드어로 변환하여 공통이성 추론에 대한 강력한 평가 기준을 제공하였다.

실험 결과

연구 질문

  • RQ1대규모이고 정제된 웹 크롤링 코퍼스가 정제된 코퍼스와 비교해 아이슬란드어 NLP 과제에서 최고 성능을 낼 수 있는가?
  • RQ2다국어 미사전훈련된 모델로 초기화하는 것(온기 시작)이 아이슬란드어 기반의 후행 과제에서 성능 향상에 기여하는가?
  • RQ3자원이 적거나 중간 수준의 언어 환경에서 고품질의 도메인 중심 웹 크롤링 코퍼스(IC3)가 전통적인 정제된 코퍼스보다 얼마나 효과적인가?
  • RQ4단일 언어(아이슬란드어)로 훈련된 언어 모델이 아이슬란드어 전용 과제에서 다국어 모델을 얼마나 뛰어나게 성능을 낼 수 있는가?
  • RQ5수동으로 적응시킨 공통이성 추론 데이터셋이 아이슬란드어 NLP에 대한 평가의 엄밀함과 기준 성능 향상에 얼마나 효과적인가?

주요 결과

  • 정제된 IC3 코퍼스로 훈련된 IceBERT는 품사 태깅, NER, 구성 구문 분석 등 다양한 후행 과제에서 최고 성능을 기록하였다.
  • 정제된 크롤링 코퍼스(IC3)로 훈련된 모델가 정제된 아이슬란드어 Gigaword 코퍼스로 훈련된 모델와 유사한 성능을 달성하여, 적절히 정제된 웹 크롤링 데이터가 자원이 적은 환경에서 효과적임을 입증하였다.
  • 온기 시작 전략—XLM-R-base를 아이슬란드어 데이터로 미세조정—이 명명된 엔티티 인식 및 문법 오류 탐지 과제에서 최고 성능을 기록하였다.
  • 수동으로 번역하고 적응시킨 아이슬란드어 버전의 WinoGrande는 공통이성 추론에 대한 더 강력하고 언어학적으로 관련성이 높은 평가 기준을 제공하였다.
  • 특정 .is 도메인에 초점을 맞춘 크롤링을 통해 추출된 IC3 코퍼스는 고성능 모델 훈련에 효과적이었으며, 저자원 언어에 대한 확장 가능한 방법임을 시사하였다.
  • 본 연구는 아이슬란드어와 같은 언어에서 정제된 대규모 크롤링 코퍼스와 다국어 모델에서의 온기 시작 전략을 조합함으로써, 광범위한 정제된 데이터가 없더라도 최고 성능을 달성할 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.