Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Leaving No Indic Language Behind: Building Monolingual Corpora, Benchmark and Models for Indic Languages

Sumanth Doddapaneni, Rahul Aralikatte|arXiv (Cornell University)|2022. 12. 11.
Natural Language Processing Techniques인용 수 11
한 줄 요약

이 논문은 24개 인도어 언어(209억 토큰)를 위한 가장 큰 단어장어 어휘자료인 IndicCorp v2, 20개 언어와 9개 NLU 작업을 아우르는 105개 평가 세트를 포함한 IndicXTREME 벤치마크, 그리고 이 데이터에 맞추어 미세조정된 다국어 모델인 IndicBERT v2를 소개한다. 이 모델은 다양한 작업에서 강력한 베이스라인 대비 평균 F1 점수 2포인트 향상하여 저자원 인도어 언어의 NLU 분야에서 크게 발전시켰다.

ABSTRACT

Building Natural Language Understanding (NLU) capabilities for Indic languages, which have a collective speaker base of more than one billion speakers is absolutely crucial. In this work, we aim to improve the NLU capabilities of Indic languages by making contributions along 3 important axes (i) monolingual corpora (ii) NLU testsets (iii) multilingual LLMs focusing on Indic languages. Specifically, we curate the largest monolingual corpora, IndicCorp, with 20.9B tokens covering 24 languages from 4 language families - a 2.3x increase over prior work, while supporting 12 additional languages. Next, we create a human-supervised benchmark, IndicXTREME, consisting of nine diverse NLU tasks covering 20 languages. Across languages and tasks, IndicXTREME contains a total of 105 evaluation sets, of which 52 are new contributions to the literature. To the best of our knowledge, this is the first effort towards creating a standard benchmark for Indic languages that aims to test the multilingual zero-shot capabilities of pretrained language models. Finally, we train IndicBERT v2, a state-of-the-art model supporting all the languages. Averaged across languages and tasks, the model achieves an absolute improvement of 2 points over a strong baseline. The data and models are available at https://github.com/AI4Bharat/IndicBERT.

연구 동기 및 목표

  • 인도어 언어가 NLP에서 부족하게 다루워지는 문제를 해결하기 위해 대규모 고품질의 단어장어 어휘자료를 구축하기 위해.
  • 다국어 제로샷 능력을 평가하기 위한 표준화되고 인간이 감시하는 벤치마크를 구축하기 위해.
  • 정제된 단어장어 어휘자료를 사용하여 인도어 언어에 특화된 최첨단 다국어 언어 모델인 IndicBERT v2를 훈련하기 위해.
  • 데이터 품질, 평가 방법, 모델 용량 향상을 통해 다국어 NLP에서 고자원 언어와 저자원 언어 간의 성능 격차를 줄이기 위해.

제안 방법

  • 4개 언어계열의 24개 인도어 언어에서 어휘 품질과 언어 정확도를 확보하기 위해 인간이 검증한 URL에서 크롤링한 정제된 IndicCorp v2를 구축하였다.
  • 인간이 애너테이션한 테스트 세트를 포함한 제로샷 전이 평가를 포함한 9개의 다양한 NLU 작업을 아우르는 105개의 평가 세트를 포함한 IndicXTREME를 구축하였다.
  • 모든 24개 인도어 언어를 지원하도록 개선된 아키텍처를 사용하여 마스크된 언어 모델링을 통해 IndicCorp v2에서 IndicBERT v2를 미세조정하였다.
  • 모델의 일반화 및 강건성을 향상시키기 위해 역번역 및 단어장어 어휘 필터링과 같은 데이터 증강 기법을 적용하였다.
  • 표준 지표(F1, 정확도)를 사용하여 여러 작업에서 모델 성능을 평가하고, mBERT, XLM-R, MuRIL과의 성능을 비교하였다.
  • 언어와 작업 간 공정한 비교와 재현 가능성을 확보하기 위해 체계적인 평가 프로토콜을 사용하였다.

실험 결과

연구 질문

  • RQ1인도어 언어를 위한 대규모 고품질의 단어장어 어휘자료가 다국어 모델 성능을 크게 향상시킬 수 있는가?
  • RQ2표준화되고 인간이 감시하는 벤치마크가 저자원 인도어 언어에서 제로샷 전이 능력을 신뢰성 있게 평가하는 데 기여하는가?
  • RQ3다국어 모델을 혼합 언어 어휘자료에서 사전 훈련한 것과는 달리 인도어 단어장어 어휘자료 전용으로 훈련한 모델이 성능 향상에 얼마나 기여하는가?
  • RQ4데이터 품질과 출처 검증이 저자원 언어 NLP에서 모델 성능과 안전성에 어떤 영향을 미치는가?
  • RQ5데이터 증강 및 미세조정 전략이 인도어 언어 모델의 제로샷 일반화 능력을 추가로 향상시킬 수 있는가?

주요 결과

  • IndicCorp v2는 24개 인도어 언어에 걸쳐 총 209억 토큰을 포함하며, 이는 이전 작업 대비 2.3배 증가했고, 12개 추가 언어를 지원한다.
  • IndicXTREME는 9개의 다양한 NLU 작업을 아우르는 105개의 평가 세트를 포함하며, 문헌에 52개의 신규 기여를 하였고, 인도어 언어에서 다국어 제로샷 능력을 평가하기 위해 전용으로 설계된 첫 번째 벤치마크이다.
  • IndicBERT v2는 IndicXTREME 벤치마크의 모든 언어와 작업에서 강력한 베이스라인 대비 평균 F1 점수 2포인트 향상하였다.
  • 벤치마크의 모든 20개 언어에서 mBERT, XLM-R, MuRIL을 초월하였으며, Bodo, Dogri, Kashmiri와 같은 저자원 언어에서 뚜렷한 성능 향상을 보였다.
  • 역번역 및 Samanantar 방법과 같은 데이터 증강 기법이 성능 향상에 기여하였고, IndicBERT-SS는 모든 작업에서 평균 점수 60.3을 기록하여 최고 성능을 달성하였다.
  • 어휘자료 구축 시 검증된 URL을 사용함으로써 mC4 대비 악성 콘텐츠가 90% 감소하여 데이터 품질과 안전성이 크게 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.