[論文レビュー] Paramanu: Compact and Competitive Monolingual Language Models for Low-Resource Morphologically Rich Indian Languages
Paramanuは、5つの低リソースで屈曲語彙を持つインド諸言語(ベンガル語、ヒンディー語、マラーティー語、タミル語、テルグ語)向けに、1つのGPUで1,000ドル未満の予算内で、スクラッチから訓練されたコンパクトで単言語の自己回帰的言語モデルのファミリーを紹介する。形態論的に整合した低熟度のトークナイザーと、新しいRoPEベースのシーケンススケーリング手法を用いて、1億800万~3億6,700万パラメータのモデルが、全言語でより大きな多言語モデルを上回る性能を発揮し、高い効率性と精度のトレードオフを実証した。
Multilingual large language models (LLMs) are expensive to pretrain and often suffer from imbalances across languages and datasets, English-centric bias, tokenizer oversegmentation for morphologically rich low-resource languages, and the curse of multilinguality. We introduce PARAMANU, the first family of Indian-only autoregressive language models trained from scratch on open-source language-specific data for the five most spoken Indian languages: Bengali, Hindi, Marathi, Tamil, and Telugu. All models are designed for affordability and are trained on a single GPU with a budget under $1,000, allowing under-resourced researchers to build competitive language models. To address low-resource challenges, we develop morphology-aligned, low-fertility tokenizers, propose an interpolation-based method for token position indices in RoPE based scaling to train longer sequences efficiently. We also create instruction-tuning datasets in Bangla that are translated to the other four languages. Despite their small size (108M-367M parameters), Paramanu achieves a strong performance-efficiency tradeoff and outperforms most larger multilingual models across all five languages. Our collection is available at https://huggingface.co/collections/mitodru/paramanu.
研究の動機と目的
- 多言語LLMが低リソースで屈曲語彙を持つインド諸言語において抱える制限、特に英語中心のバイアスと高い事前訓練コストを是正すること。
- 低リソースの研究者でも最小限の計算リソースで訓練可能な、低コストで効率的な言語モデルの開発。
- 言語固有の形態論に整合したトークナイゼーションと最適化された注意機構を用いて、低リソース環境での性能向上。
- バングラ語から翻訳された多言語の指示微調整データセットの作成により、インド諸言語における指示微調整の実現。
- 小さな単言語モデルが、低リソース言語タスクにおいて、より大きな多言語モデルを上回ることを実証すること。
提案手法
- ベンガル語、ヒンディー語、マラーティー語、タミル語、テルグ語の5言語について、オープンソースの言語固有のデータセットを用いて、スクラッチから単言語言語モデルを訓練。
- サブワード断片化を低減し、インド諸言語の形態論的複雑性をよりよく表現するため、形態論的に整合した低熟度のトークナイザーを設計。
- RoPE(回転位置埋め込み)インデックスの補間に基づく手法を導入し、コンテキスト長を増加させることなく、より長いシーケンスでの効率的訓練を可能に。
- 1つのGPUで、総予算が1,000ドル未満となるようにモデルを訓練し、低リソース研究者にとっての費用対効果とアクセス可能性を確保。
- 他の4つのインド諸言語にバングラ語の指示データを翻訳することで、多言語の指示微調整データセットを構築。
- 低リソースの微調整に最適化されたハイパーパramータを備えた、標準的な自己回帰的Transformerアーキテクチャを採用。
実験結果
リサーチクエスチョン
- RQ1低リソースのインド諸言語でスクラッチから訓練されたコンパクトな単言語言語モデルは、より大きな多言語モデルを上回る性能を発揮できるか?
- RQ2形態論的に整合したトークナイゼーションは、形態論的に豊富で低リソースの言語での性能をどのように向上させるか?
- RQ3RoPEベースのシーケンススケーリングは、小規模なモデルでより長いシーケンスの効率的訓練をどの程度可能にするか?
- RQ4高品質なバングラ語データの翻訳により、インド諸言語における指示微調整モデルを効果的に構築できるか?
- RQ5低リソース環境において、小さな単一言語モデルと大きな多言語モデルの間で、性能と効率のトレードオフはいかなるものか?
主な発見
- 1億800万~3億6,700万パラメータのParamanuモデルは、5言語すべての下流タスクで、大多数のより大きな多言語モデルを上回る性能を発揮した。
- 形態論的に整合した低熟度のトークナイザーは、サブワード断片化を顕著に低減し、インド諸言語の形態論的複雑性の表現を向上させた。
- 補間に基づくRoPEスケーリング手法により、計算コストやコンテキスト長を増加させることなく、より長いシーケンスでの効率的訓練が可能になった。
- 1つのGPUで1,000ドル未満の予算で訓練されたことにより、低リソースの研究者にとって高品質な言語モデリングが実現可能になった。
- バングラ語から翻訳された指示微調整データセットにより、インド諸言語間でゼロショットおよびフェイズショットの転移学習が効果的に可能になった。
- 非常に小さなサイズにもかかわらず、Paramanuモデルはベンチマークタスクで競争力のある性能を達成し、強力な効率性と精度のトレードオフを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。