[论文解读] Paramanu: Compact and Competitive Monolingual Language Models for Low-Resource Morphologically Rich Indian Languages
Paramanu 提出了一类针对五种低资源、词形丰富的印度语言(孟加拉语、印地语、马拉地语、泰米尔语和泰卢固语)的紧凑、单语自回归语言模型,这些模型在单张 GPU 上、总预算低于 1,000 美元的条件下从零开始训练。通过使用与词形对齐的低频次分词器以及一种新型基于 RoPE 的序列扩展方法,参数量在 108M 到 367M 之间的模型在所有语言中均优于更大的多语言模型,展现出优异的效率-准确率权衡。
Multilingual large language models (LLMs) are expensive to pretrain and often suffer from imbalances across languages and datasets, English-centric bias, tokenizer oversegmentation for morphologically rich low-resource languages, and the curse of multilinguality. We introduce PARAMANU, the first family of Indian-only autoregressive language models trained from scratch on open-source language-specific data for the five most spoken Indian languages: Bengali, Hindi, Marathi, Tamil, and Telugu. All models are designed for affordability and are trained on a single GPU with a budget under $1,000, allowing under-resourced researchers to build competitive language models. To address low-resource challenges, we develop morphology-aligned, low-fertility tokenizers, propose an interpolation-based method for token position indices in RoPE based scaling to train longer sequences efficiently. We also create instruction-tuning datasets in Bangla that are translated to the other four languages. Despite their small size (108M-367M parameters), Paramanu achieves a strong performance-efficiency tradeoff and outperforms most larger multilingual models across all five languages. Our collection is available at https://huggingface.co/collections/mitodru/paramanu.
研究动机与目标
- 为解决多语言大语言模型在低资源、词形丰富的印度语言中的局限性,包括以英语为中心的偏见和高昂的预训练成本。
- 开发经济实惠、高效的语言模型,使资源有限的研究人员能够使用极少的计算资源进行训练。
- 通过语言特定的、与词形对齐的分词方法和优化的注意力机制,在低资源环境下提升性能。
- 通过将孟加拉语指令数据翻译至其他语言,创建多语言指令微调数据集,实现在印度语言中的指令微调。
- 证明小型单语模型在低资源语言任务中可超越更大的多语言模型。
提出的方法
- 在开源、语言特定的数据集上,从零开始训练孟加拉语、印地语、马拉地语、泰米尔语和泰卢固语的单语语言模型。
- 设计与词形对齐的低频次分词器,以减少子词碎片化,并提升对词形复杂性的表示能力。
- 提出一种基于插值的 RoPE(旋转位置嵌入)索引扩展方法,实现无需增加上下文长度即可高效训练长序列。
- 在单张 GPU 上训练模型,总预算控制在 1,000 美元以内,以确保对低资源研究者的可及性和经济性。
- 通过将孟加拉语指令数据翻译至其余四种印度语言,构建多语言指令微调数据集。
- 采用标准的自回归 Transformer 架构,并针对低资源微调优化超参数。
实验结果
研究问题
- RQ1在低资源印度语言上从零开始训练的紧凑单语语言模型,是否能超越更大的多语言模型?
- RQ2与词形对齐的分词方法在词形丰富、低资源语言中如何提升性能?
- RQ3基于 RoPE 的序列扩展方法在小型模型中能在多大程度上实现长序列的高效训练?
- RQ4能否通过高质量孟加拉语数据的翻译,有效构建印度语言中的指令微调模型?
- RQ5在低资源环境下,小型单语言模型与更大多语言模型相比,其性能-效率权衡如何?
主要发现
- Paramanu 模型参数量仅为 108M 至 367M,在所有五种印度语言的下游任务中均优于大多数更大的多语言模型。
- 与词形对齐的低频次分词器显著减少了子词碎片化,并提升了对印度语言词形复杂性的表示能力。
- 基于插值的 RoPE 扩展方法实现了无需增加计算成本或上下文长度即可高效训练长序列。
- 在单张 GPU 上、预算低于 1,000 美元的条件下训练,使高质量语言建模对资源有限的研究者触手可及。
- 通过孟加拉语翻译构建的指令微调数据集,可在印度语言之间实现有效的零样本和少样本迁移学习。
- 尽管参数量小,Paramanu 模型在基准任务上仍表现出具有竞争力的性能,展现出强大的效率-准确率权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。