Skip to main content
QUICK REVIEW

[논문 리뷰] L3Cube-HindBERT and DevBERT: Pre-Trained BERT Transformer models for Devanagari based Hindi and Marathi Languages

Raviraj Joshi|arXiv (Cornell University)|2022. 11. 21.
Natural Language Processing Techniques인용 수 15
한 줄 요약

이 논문은 히ند리어 및 마라티어를 위해 각각 대규모 데바나가리 스크립트로 구성된 단어별 BERT 모델인 L3Cube-HindBERT와 DevBERT를 소개한다. 각각 18억 개와 25억 개 토큰으로 훈련된 이 모델들은 히ند리어 및 마라티어 텍스트 분류 및 명명된 실체 인식 작업에서 다국어 대비 성능이 뛰어나며, 충분한 단어별 데이터가 확보된 경우 단어별 사전 훈련이 더 우수한 성능을 낼 수 있음을 입증한다.

ABSTRACT

The monolingual Hindi BERT models currently available on the model hub do not perform better than the multi-lingual models on downstream tasks. We present L3Cube-HindBERT, a Hindi BERT model pre-trained on Hindi monolingual corpus. Further, since Indic languages, Hindi and Marathi share the Devanagari script, we train a single model for both languages. We release DevBERT, a Devanagari BERT model trained on both Marathi and Hindi monolingual datasets. We evaluate these models on downstream Hindi and Marathi text classification and named entity recognition tasks. The HindBERT and DevBERT-based models show significant improvements over multi-lingual MuRIL, IndicBERT, and XLM-R. Based on these observations we also release monolingual BERT models for other Indic languages Kannada, Telugu, Malayalam, Tamil, Gujarati, Assamese, Odia, Bengali, and Punjabi. These models are shared at https://huggingface.co/l3cube-pune .

연구 동기 및 목표

  • 기존의 단어별 히нд리어 BERT 모델이 다국어 모델에 비해 하위 작업 NLP 과제에서 성능이 열 劣하는 문제를 해결하기 위해.
  • 히ند리어와 마라티어가 공통된 데바나가리 스크립트를 공유하므로, 이 두 언어를 위한 단일 통합 BERT 모델(DevBERT)을 훈련시키기 위해 이를 활용하기 위해.
  • 고품질의 단어별 사전 훈련된 모델을 제공함으로써 저자원 인도 언어 NLP 과제의 성능을 향상시키기 위해.
  • 카나다어, 텔루구어, 타밀어를 포함한 9개의 추가 인디크 언어에 대해 단어별 BERT 모델을 공개함으로써 이 접근법을 확장하기 위해.
  • Hugging Face 모델 허브를 통해 연구자들과 전문가들이 인도 언어 NLP 작업을 수행할 수 있도록 공개적이고 접근 가능한 자원을 제공하기 위해.

제안 방법

  • 마스크된 언어 모델링을 사용하여 BERT 아키텍처를 기반으로 18억 토큰의 단어별 히нд리어 텍스트로 L3Cube-HindBERT를 사전 훈련하였다.
  • 공통된 스크립트와 언어학적 유사성을 활용하여 히нд리어와 마라티어의 단어별 텍스트 총 25억 토큰으로 DevBERT를 사전 훈련하였다.
  • 표준 NLP 벤치마크를 사용하여 하위 작업 분류 및 명명된 실체 인식 과제에서 모델을 미세 조정하였다.
  • 상호 운용성과 사용 편의성을 위해 일관된 아키텍처와 토크나이저 설계를 갖춘 Hugging Face를 통해 모델을 배포하였다.
  • 사용자 정의 토크나이저와 대규모 단어별 자료를 사용하여 9개의 다른 인디크 언어에 대해 단어별 BERT 모델을 새로 훈련하였다.
  • 표준 데이터셋에서 다국어 모델(MuRIL, XLM-R, IndicBERT)과 기존의 단어별 모델(MahaBERT)에 비해 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1대규모 히нд리어 자료로 사전 훈련된 단어별 히нд리어 BERT 모델이 기존의 다국어 모델보다 히нд리어 NLP 과제에서 더 뛰어난 성능을 낼 수 있는가?
  • RQ2히нд리어와 마라티어가 공통된 데바나가리 스크립트를 공유하므로, 이 두 언어의 데이터로 단일 BERT 모델(DevBERT)을 훈련시키는 것이 각 언어에서 경쟁 가능한 성능을 낼 수 있는가?
  • RQ3L3Cube-HindBERT와 DevBERT의 성능은 히нд리어 및 마라티어 하위 작업 과제에서 최신의 다국어 모델(MuRIL, XLM-R, IndicBERT)과 비교해 어떻게 되는가?
  • RQ4카나다어, 텔루구어, 말라요람어 등과 같은 저자원 인도 언어에 대해 단어별 BERT 모델을 효과적으로 훈련하고 배포함으로써 NLP 성능 향상에 기여할 수 있는가?
  • RQ5충분한 단어별 데이터가 확보된 경우, 단일 언어에 대해 단어별 모델을 미세 조정하는 것이 다국어 모델을 사용하는 것보다 더 좋은 결과를 낼 수 있는가?

주요 결과

  • L3Cube-HindBERT는 IITP 히нд리어 영화 리뷰 분류 데이터셋에서 69.00%의 정확도를 기록하여 MuRIL(66.00%), XLM-R(67.00%), IndicBERT(65.00%)를 모두 앞섰다.
  • DevBERT는 L3Cube-MahaNER 마라티어 NER 데이터셋에서 매크로-F1 점수 88.31을 기록하여 MahaBERT(88.00)와 다른 다국어 모델을 모두 능가했다.
  • 히нд리어 위키앤 NER 과제에서 DevBERT는 매크로-F1 점수 85.00을 기록하여 MuRIL(84.90), XLM-R(83.04), IndicBERT(82.65)를 앞섰다.
  • L3Cube-HindBERT는 히нд리어 텍스트 분류 과제에서 다음으로 좋은 다국어 모델(XLM-R)보다 2.00%p 향상된 성능을 보였다.
  • DevBERT는 L3Cube-MahaSent 마라티어 감성 분류 과제에서 85.00%의 정확도를 기록하여 MuRIL(84.30%)과 XLM-R(82.00%)를 초월했다.
  • 저자들은 카나다어, 텔루구어, 말라요람어, 타밀어, 구자라트어, 아삼어, 온디어, 법인어, 펀자브어를 포함한 9개의 추가 인디크 언어에 대해 단어별 BERT 모델을 공개하였으며, 모두 Hugging Face에서 공개적으로 사용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.