[논문 리뷰] Paramanu: Compact and Competitive Monolingual Language Models for Low-Resource Morphologically Rich Indian Languages
Paramanu는 1,000달러 미만의 단일 GPU 예산으로, 법인, 힌두어, 마라티, 타밀, 텔루구어 등 5개의 저자원, 형태소가 풍부한 인도 언어를 대상으로 한, 새로 훈련된 단일 언어 기반 자동회귀 언어 모델의 가족을 소개한다. 형태소에 맞춘 낮은 번성도를 가진 토크나이저와 새로운 RoPE 기반의 시퀀스 스케일링 방법을 사용하여, 108M~367M 파라미터를 가진 모델들이 모든 언어에서 더 큰 다국어 모델들을 능가하며, 뛰어난 효율-정확도 균형을 보여줍니다.
Multilingual large language models (LLMs) are expensive to pretrain and often suffer from imbalances across languages and datasets, English-centric bias, tokenizer oversegmentation for morphologically rich low-resource languages, and the curse of multilinguality. We introduce PARAMANU, the first family of Indian-only autoregressive language models trained from scratch on open-source language-specific data for the five most spoken Indian languages: Bengali, Hindi, Marathi, Tamil, and Telugu. All models are designed for affordability and are trained on a single GPU with a budget under $1,000, allowing under-resourced researchers to build competitive language models. To address low-resource challenges, we develop morphology-aligned, low-fertility tokenizers, propose an interpolation-based method for token position indices in RoPE based scaling to train longer sequences efficiently. We also create instruction-tuning datasets in Bangla that are translated to the other four languages. Despite their small size (108M-367M parameters), Paramanu achieves a strong performance-efficiency tradeoff and outperforms most larger multilingual models across all five languages. Our collection is available at https://huggingface.co/collections/mitodru/paramanu.
연구 동기 및 목표
- 다국어 LLM이 저자원, 형태소가 풍부한 인도 언어에서 겪는 한계, 즉 영어 중심 편향과 높은 사전훈련 비용을 해결하기 위해.
- 저자원 연구자들이 최소한의 계산 자원으로도 훈련할 수 있는 저비용이고 효율적인 언어 모델을 개발하기 위해.
- 언어별로 특화된 형태소에 맞춘 토크나이징과 최적화된 어텐션 메커니즘을 통해 저자원 환경에서의 성능을 향상시키기 위해.
- 방글라어에서 번역한 다국어 지시 훈련 데이터를 통해 인도 언어에서의 지시 훈련을 가능하게 하기 위해.
- 작은 단일 언어 모델이 저자원 언어 작업에서 더 큰 다국어 모델을 능가할 수 있음을 입증하기 위해.
제안 방법
- 벵골어, 힌두어, 마라티어, 타밀어, 텔루구어를 위한 오픈소스이자 언어별로 특화된 데이터셋에서 단일 언어 기반 언어 모델을 새로 훈련하기 위해.
- 서브워드 분할을 줄이고 형태소 복잡성을 더 잘 표현하기 위해 형태소에 맞춘 낮은 번성도를 가진 토크나이저를 설계하기 위해.
- 컨텍스트 길이를 늘리지 않고도 더 긴 시퀀스에서 효율적으로 훈련할 수 있도록 RoPE(Rotary Position Embedding) 인덱스를 보간 기반으로 스케일링하는 방법을 도입하기 위해.
- 모델을 단일 GPU에서 훈련하고 총 예산을 1,000달러 이내로 유지하여 저자원 연구자들에게 접근 가능하고 저비용이 되도록 하기 위해.
- 기타 4개의 인도 언어로 방글라어 지시 데이터를 번역하여 다국어 지시 훈련 데이터셋을 구축하기 위해.
- 저자원 미세조정을 위해 최적화된 초모수를 가진 표준 자동회귀 트랜스포머 아키텍처를 사용하기 위해.
실험 결과
연구 질문
- RQ1저자원 인도 언어에서 새로 훈련된 컴팩트한 단일 언어 기반 언어 모델이 더 큰 다국어 모델을 능가할 수 있는가?
- RQ2형태소에 맞춘 토크나이징은 형태소가 풍부한 저자원 언어에서 성능을 어떻게 향상시키는가?
- RQ3RoPE 기반의 시퀀스 스케일링은 작은 모델에서 더 긴 시퀀스 훈련을 얼마나 효율적으로 가능하게 하는가?
- RQ4고품질의 방글라어 데이터를 번역함으로써 인도 언어에서의 지시 훈련 모델을 효과적으로 만들 수 있는가?
- RQ5저자원 환경에서 작은 단일 언어 모델과 더 큰 다국어 모델 간의 성능-효율성 균형은 어떠한가?
주요 결과
- 108M에서 367M 파라미터를 가진 Paramanu 모델은 모든 5개의 인도 언어에서 다운스트림 작업에서 대부분의 더 큰 다국어 모델을 능가합니다.
- 형태소에 맞춘 낮은 번성도 토크나이저는 서브워드 분할을 크게 줄이고 인도 언어의 형태소 복잡성을 더 잘 표현합니다.
- 보간 기반 RoPE 스케일링 방법은 커텍스트 길이나 계산 비용을 늘리지 않고도 더 긴 시퀀스에서의 효율적 훈련을 가능하게 합니다.
- 단일 GPU에서 1,000달러 이내의 예산으로 훈련함으로써 고품질 언어 모델링이 저자원 연구자들에게 접근 가능해졌습니다.
- 방글라어에서 번역한 지시 훈련 데이터셋 덕분에 인도 언어 간에 제로샷 및 피처샷 전이 학습이 효과적으로 가능해졌습니다.
- 작은 크기임에도 불구하고 Paramanu 모델은 벤치마크 작업에서 경쟁적인 성능을 달성하며 강력한 효율-정확도 균형을 보여줍니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.