[论文解读] CINO: A Chinese Minority Pre-trained Language Model
CINO 是一种用于汉语少数民族语言的多语言预训练语言模型,涵盖普通话、粤语、藏语、蒙古语、维吾尔语、哈萨克语和壮语。通过采用掩码语言建模目标进行多语言预训练,CINO 在低资源民族语言上的零样本跨语言迁移性能得到提升,在 WCM 和 CMNews 数据集上显著优于 XLM-R 和其他基线模型,尤其在藏语和维吾尔语等代表性不足的语言上表现突出。
Multilingual pre-trained language models have shown impressive performance on cross-lingual tasks. It greatly facilitates the applications of natural language processing on low-resource languages. However, there are still some languages that the current multilingual models do not perform well on. In this paper, we propose CINO (Chinese Minority Pre-trained Language Model), a multilingual pre-trained language model for Chinese minority languages. It covers Standard Chinese, Yue Chinese, and six other ethnic minority languages. To evaluate the cross-lingual ability of the multilingual model on ethnic minority languages, we collect documents from Wikipedia and news websites, and construct two text classification datasets, WCM (Wiki-Chinese-Minority) and CMNews (Chinese-Minority-News). We show that CINO notably outperforms the baselines on various classification tasks. The CINO model and the datasets are publicly available at http://cino.hfl-rc.com.
研究动机与目标
- 为解决低资源汉语少数民族语言(如藏语、维吾尔语和蒙古语)缺乏有效多语言预训练模型的问题。
- 通过将多语言预训练扩展至高资源语言之外的低资源语言,提升代表性不足的民族语言的跨语言迁移性能。
- 构建并发布两个多语言文本分类数据集——WCM(来自维基百科)和 CMNews(来自新闻源),用于评估汉语少数民族语言的零样本跨语言能力。
- 证明在多样且低资源的语言上进行多语言预训练,相比单语言或高资源语言偏倚的模型,能获得更优的性能。
提出的方法
- CINO 基于 XLM-R 架构,但通过调整词汇表大小以支持汉语少数民族语言,包括使用非拉丁字母的文字。
- 采用适配多语言效率的掩码语言建模(MLM)目标进行模型预训练,降低计算成本。
- 预训练数据来自维基百科和新闻网站,重点涵盖低资源语言如藏语和维吾尔语,这些语言在现有语料库中代表性不足。
- 在多语言文本分类任务上对模型进行微调,采用零样本跨语言迁移设置,即在一种语言上进行训练,而在其他语言上进行评估。
- 通过多语言上的宏平均 F1 分数评估性能,模型选择基于源语言验证集上的表现。
- 构建了两个基准数据集——WCM(10 个类别,63,000 个样本)和 CMNews(8 个类别,57,000 个样本),用于对汉语少数民族语言进行零样本评估。
实验结果
研究问题
- RQ1多语言预训练语言模型能否显著提升在低资源汉语少数民族语言上的零样本跨语言迁移性能?
- RQ2在藏语、维吾尔语和蒙古语等代表性不足的语言上,CINO 与现有模型(如 XLM-R 和 XLM-R-Ext)相比表现如何?
- RQ3与现有模型中高资源语言偏倚相比,在多样且低资源的少数民族语言上进行预训练,能在多大程度上提升性能?
- RQ4CINO 的多语言架构是否能更有效地实现从高资源语言(如普通话)向低资源少数民族语言的知识迁移?
- RQ5在低资源语言(如维吾尔语)上性能波动的成因是什么?这些因素如何缓解?
主要发现
- 在 WCM 数据集中,CINO-base 在所有少数民族语言上的表现均优于 XLM-R-base,其中藏语、哈萨克语和维吾尔语的性能提升最为显著,这些语言在 XLM-R 中支持较弱。
- 在 CMNews 数据集中,CINO-large 在大多数少数民族语言上的表现优于 XLM-R-large,表明在少数民族语言数据上微调后,多语言迁移效果显著。
- CINO 在 WCM 上展现出卓越的零样本跨语言性能,其在少数民族语言上的平均宏 F1 分数显著高于 XLM-R。
- CINO 在 WCM 数据集上对少数民族语言的宏 F1 达到 68.7,优于 XLM-R-base(59.2)和 XLM-R-large-Ext(63.1),表明其从普通话实现了强大的零样本迁移能力。
- 在 YNAT 韩语文本分类基准上,CINO-large 的表现与 KLUE-BERT-base 相当,并在重现实验中超越了 XLM-R-large,尽管韩语在 XLM-R 中已有良好覆盖。
- 维吾尔语上的性能在不同运行中波动较大,表明低资源微调存在不稳定性,这可能是 CINO-large 平均得分低于 XLM-R-large 尽管峰值更高的原因。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。