[논문 리뷰] L3Cube-MahaCorpus and MahaBERT: Marathi Monolingual Corpus, Marathi BERT Language Models, and Resources
이 논문은 다양한 인터넷 소스에서 수집한 2480만 문장, 2억 8900만 토큰의 마라티어 단어장어어어 단어장어어어를 기반으로 한 L3Cube-MahaCorpus를 소개하고, 전체 7억 5200만 토큰의 마라티어 단어장어어어를 기반으로 사전 훈련된 다국어 BERT 기반 언어 모델인 MahaBERT, MahaAlBERT, MahaRoBERTa 및 생성형 GPT 모델인 MahaGPT를 제시한다. 이 모델들은 마라티어 다운스트림 작업에서 최신 기술 수준의 성능을 달성하며, 텍스트 분류 및 명명된 실체 인식(NER) 분야에서 다국어 기준 모델들을 능가한다.
We present L3Cube-MahaCorpus a Marathi monolingual data set scraped from different internet sources. We expand the existing Marathi monolingual corpus with 24.8M sentences and 289M tokens. We further present, MahaBERT, MahaAlBERT, and MahaRoBerta all BERT-based masked language models, and MahaFT, the fast text word embeddings both trained on full Marathi corpus with 752M tokens. We show the effectiveness of these resources on downstream Marathi sentiment analysis, text classification, and named entity recognition (NER) tasks. We also release MahaGPT, a generative Marathi GPT model trained on Marathi corpus. Marathi is a popular language in India but still lacks these resources. This work is a step forward in building open resources for the Marathi language. The data and models are available at https://github.com/l3cube-pune/MarathiNLP .
연구 동기 및 목표
- 비뉴스 인터넷 소스에서 유래한 2480만 문장과 2억 8900만 토큰을 추가함으로써 기존 데이터셋을 확장하여 대규모이고 다양한 마라티어 단어장어어어의 부족 문제를 해결한다.
- 마라티어 NLP를 위한 고성능의 단어장어어어 BERT 기반 언어 모델(MahaBERT, MahaAlBERT, MahaRoBERTa)과 생성형 MahaGPT 모델을 개발한다.
- 마라티어 전체 단어장어어어를 기반으로 훈련된 MahaFT라는 fastText 단어 임베딩 모델을 훈련하고, 이를 다운스트림 NLP 작업에 제공한다.
- 이 자원들이 마라티어 전용 NLP 작업, 즉 텍스트 분류, 감성 분석, 명명된 실체 인식(NER)에서 효과적인지 평가한다.
- 저자원 인도어 언어 NLP 분야의 연구 및 개발을 지원하기 위해 오픈소스이자 고품질의 마라티어 NLP 자원을 제공한다.
제안 방법
- 비뉴스 콘텐츠를 포함한 다양한 인터넷 소스에서 마라티어 단어장어어어를 크롤링하고 정제하여 데이터 편향을 줄인다.
- L3Cube-MahaCorpus를 기존 공개 마라티어 단어장어어어(예: IndicNLP, OSCAR, CC-100)와 융합하여 총 7억 5200만 토큰의 훈련 데이터셋을 구성한다.
- 전체 단어장어어어를 기반으로 마스크된 언어 모델링(MLM)과 다음 문장 예측 목표를 사용하여 세 가지 BERT 기반 모델(MahaBERT, MahaAlBERT, MahaRoBERTa)을 사전 훈련한다.
- 마라티어 텍스트 분류(뉴스 기사, 헤드라인), 감성 분석(L3CubeMahaSent), 그리고 최종 토큰 임베딩 위에 CRF 레이어를 추가하여 NER 작업에 BERT 모델을 미세조정한다.
- 전체 마라티어 단어장어어어를 기반으로 스킵그램 아키텍처를 사용하여 MahaFT라는 fastText 단어 임베딩 모델을 훈련하고, 문장 수준 작업에서 KNN 분류기로 평가한다.
- 자기회귀 언어 모델링 목표를 사용하여 전체 마라티어 단어장어어어를 기반으로 MahaGPT라는 생성형 언어 모델을 훈련하고 배포한다.
실험 결과
연구 질문
- RQ1기존의 뉴스 중심의 단어장어어어에 비해 대규모이고 다양한 마라티어 단어장어어어가 다운스트림 NLP 작업의 성능을 향상시키는가?
- RQ2대규모이고 다양한 마라티어 단어장어어어를 기반으로 미세조정된 단어장어어어 BERT 기반 모델이 마라티어 전용 NLP 작업에서 다국어 BERT 모델보다 뛰어나게 성능을 내는가?
- RQ3전체 마라티어 단어장어어어를 기반으로 훈련된 fastText 임베딩(MahaFT)이 기존 대안들(Facebook의 FB-FT, IndicNLP의 INLP-FT)에 비해 마라티어 텍스트 분류에서 얼마나 효과적인가?
- RQ4단어장어어어에 비뉴스 콘텐츠를 포함시킴으로써 마라티어 NLP 모델의 강건성과 일반화 능력이 얼마나 향상되는가?
- RQ5대규모이고 정제된 마라티어 단어장어어어를 기반으로 생성형 마라티어 언어 모델(MahaGPT)을 효과적으로 훈련시킬 수 있는가?
주요 결과
- MahaRoBERTa가 마라티어 NER 작업에서 매크로-F1 점수 64.34를 기록하여 mBERT(58.35)와 XLM-R(62.32)와 같은 다국어 모델들을 능가했다.
- MahaAlBERT가 L3CubeMahaSent 감성 분석 데이터셋에서 분류 정확도 83.7%를 기록하여 mBERT(80.4%)와 XLM-R(82.0%)를 초월했다.
- 전체 마라티어 단어장어어어를 기반으로 훈련된 fastText 임베딩 모델인 MahaFT는 NER 작업에서 매크로-F1 점수 91.2를 기록하여 FB-FT(88.8)와 INLP-FT(90.7)를 뛰어넘었다.
- MahaBERT, MahaAlBERT, MahaRoBERTa와 같은 단어장어어어 BERT 변종은 모든 분류 및 NER 벤치마크에서 다국어 대응 모델(mBERT, XLM-R, indicBERT)보다 일관되게 뛰어난 성능을 보였다.
- 생성형 트랜스포머인 MahaGPT 모델은 전체 마라티어 단어장어어어를 기반으로 성공적으로 훈련되었으며, 오픈소스 NLP 스위트의 일부로 배포되었다.
- L3Cube-MahaCorpus와 기존 단어장어어어를 융합하여 총 7억 5200만 토큰의 마라티어 단어장어어어 데이터셋을 구성하였으며, 이는 저자원 마라티어 NLP 자원 기반을 크게 확장하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.