Skip to main content
QUICK REVIEW

[논문 리뷰] Spanish Language Models.

Asier Gutiérrez-Fandiño, Jordi Armengol-Estapé|arXiv (Cornell University)|2021. 07. 15.
Topic Modeling참고 문헌 19인용 수 20
한 줄 요약

이 논문은 스페인 국립도서관의 웹 크롤링 자료(2009–2019)에서 수집한 청소된, 중복 제거된 스페인어 텍스트 코퍼스 570GB를 기반으로 사전 훈련한 스페인어 RoBERTa-base 및 RoBERTa-large 언어 모델을 소개한다. 이 모델들은 다수의 자연어 처리(NLP) 과제에서 최신 기술 성능을 기록하며, 확장된 추출형 질의응답 벤치마크에서도 기존의 스페인어 모델들을 능가한다.

ABSTRACT

This paper presents the Spanish RoBERTa-base and RoBERTa-large models, as well as the corresponding performance evaluations. Both models were pre-trained using the largest Spanish corpus known to date, with a total of 570GB of clean and deduplicated text processed for this work, compiled from the web crawlings performed by the National Library of Spain from 2009 to 2019. We extended the current evaluation datasets with an extractive Question Answering dataset and our models outperform the existing Spanish models across tasks and settings.

연구 동기 및 목표

  • 가장 넓은 알려진 스페인어 텍스트 코퍼스를 활용하여 고성능 스페인어 언어 모델을 개발하기 위해.
  • 평가 벤치마크를 확장함으로써, 특히 질의응답 과제에서의 성능을 향상시키기 위해.
  • 대규모이고 고품질의 데이터셋을 기반으로 사전 훈련함으로써 스페인어 NLP 분야의 새로운 최신 기술 성능를 확립하기 위해.
  • 스페인어 NLP 연구 및 응용 커뮤니티를 위해 강력하고 공개 가능한 언어 모델을 제공하기 위해.

제안 방법

  • 스페인 국립도서관이 수집한 웹 크롤링 자료(2009–2019)에서 유래한 청소되고 중복 제거된 스페인어 텍스트 총 570GB를 기반으로 RoBERTa-base 및 RoBERTa-large 모델을 사전 훈련하기 위해.
  • 스페인어에 적합하게 조정된 마스크된 언어 모델링과 다음 문장 예측을 포함한 RoBERTa 훈련 목표를 사용하기 위해.
  • 새로 도입된 추출형 질의응답 데이터셋을 포함한 다양한 하류 NLP 과제에 표준 RoBERTa 미세조정 절차를 적용하기 위해.
  • 모델 일반화 능력을 향상시키기 위해 데이터 중복 제거 및 필터링 기법을 적용하기 위해.
  • 다양한 표준 및 확장된 벤치마크를 통해 성능을 평가함으로써, 다양한 과제에 걸쳐 모델의 강건성과 일반화 능력을 입증하기 위해.

실험 결과

연구 질문

  • RQ1대규모이고 고품질의 스페인어 텍스트 코퍼스는 사전 훈련된 언어 모델의 성능을 크게 향상시킬 수 있는가?
  • RQ2제안된 RoBERTa-base 및 RoBERTa-large 모델은 표준 및 확장된 NLP 벤치마크에서 기존의 스페인어 모델들과 비교해 어떻게 성능을 내는가?
  • RQ3추출형 질의응답 벤치마크를 포함한 평가 데이터셋의 확장은 모델 평가의 정밀도를 어느 정도 향상시키는가?
  • RQ4이 모델들은 스페인어의 다양한 NLP 과제에 효과적으로 일반화될 수 있는가?

주요 결과

  • RoBERTa-base 및 RoBERTa-large 모델은 평가된 모든 과제에서 이전에 발표된 모든 스페인어 언어 모델들을 능가한다.
  • 확장된 추출형 질의응답 데이터셋에서 최신 기술 성능를 기록하며, 스판 예측 및 정답 정확도에서 뛰어난 성능을 보였다.
  • 청결하고 중복 제거된 스페인어 텍스트 코퍼스 570GB를 사용함으로써, 더 작은 크기이거나 품질이 낮은 훈련 데이터에 비해 모델 성능이 크게 향상되었다.
  • 다양한 NLP 과제에 걸쳐 강력한 일반화 능력을 보이며, 스페인어 NLP 응용 분야에서의 강건성과 광범위한 적용 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.