[论文解读] MultiFiT: Efficient Multi-lingual Language Model Fine-tuning
MultiFiT 提出了一种高效的方法,使用单张 GPU 在多种语言上微调单语语言模型,结合 ULMFiT 与 QRNN 及子词分词技术。即使仅使用 100 个标注样本,其性能也优于最先进的多语言模型(如多语言 BERT 和 LASER),表明仅用极少数据和计算资源进行单语微调,可在零样本和有监督设置下超越昂贵的多语言模型。
Pretrained language models are promising particularly for low-resource languages as they only require unlabelled data. However, training existing models requires huge amounts of compute, while pretrained cross-lingual models often underperform on low-resource languages. We propose Multi-lingual language model Fine-Tuning (MultiFiT) to enable practitioners to train and fine-tune language models efficiently in their own language. In addition, we propose a zero-shot method using an existing pretrained cross-lingual model. We evaluate our methods on two widely used cross-lingual classification datasets where they outperform models pretrained on orders of magnitude more data and compute. We release all models and code.
研究动机与目标
- 解决尽管具备零样本迁移能力,多语言模型在低资源语言上表现不佳的问题。
- 降低训练多语言语言模型的计算成本,尤其是针对低资源语言。
- 证明使用少量标注数据微调单语模型,可超越在数量级上多得多数据上训练的多语言模型。
- 探索单语和多语言预训练信号在提升鲁棒性和零样本泛化能力方面的互补性。
提出的方法
- MultiFiT 使用带有子词分词和通用语言模型微调(ULMFiT)的准循环神经网络(QRNN)架构,在单张 Tesla V100 GPU 上高效训练单语语言模型。
- 它引入了一种零样本适应方法,利用预训练的多语言模型(如 LASER)生成的伪标签来初始化目标语言中无任何标注数据的单语模型。
- 模型在每种语言的 10000 万单语维基百科数据上进行预训练,并使用最少 100 个标注样本进行微调。
- 它采用通过 SentencePiece 学习的共享子词词汇表,实现对形态丰富和低资源语言的高效处理。
- 通过将标签随机污染高达 75% 来评估对标签噪声的鲁棒性,结果表明预训练使模型在噪声监督下仍能泛化。
- 在 MLDoc 和 CLS 数据集上,对比了子词与词基分词策略以及是否包含预训练的模型变体的性能。
实验结果
研究问题
- RQ1在仅使用极少标注数据微调单语语言模型时,是否能超越需要大量平行或多语言预训练的多语言模型?
- RQ2在低资源设置下,单语数据预训练是否能提升对标签噪声的鲁棒性?
- RQ3从多语言模型生成的伪标签在实现单语微调的零样本迁移方面有多有效?
- RQ4对于低资源和形态丰富的语言,子词分词是否比词基分词更有效?
- RQ5单语和多语言预训练信号在多语言迁移学习中的互补性在多大程度上发挥作用?
主要发现
- 在有监督设置下,即使不进行预训练,仅用每种语言 1000 个标注样本微调时,MultiFiT 的性能也优于多语言 BERT 和 LASER。
- 仅用每种语言 100 个标注样本,MultiFiT 在 MLDoc 数据集的德语和法语上超越了所有零样本方法,F1 分别达到 91.34% 和 89.45%。
- 预训练的 MultiFiT 模型在高达 65% 的标签噪声下仍保持鲁棒性,而随机初始化的模型在高噪声水平下无法超过理论基线。
- 在大多数语言(包括德语和俄语)上,子词分词优于词基分词,表现为更高的准确率和更短的训练时间,得益于更小的词汇表规模。
- 使用 10000 万单语预训练数据的 MultiFiT 模型性能优于多语言 BERT 和 LASER,后者在数量级上多得多的数据和计算资源上进行训练。
- 在涵盖八种语言的 MLDoc 和 CLS 数据集上,该方法均取得了最先进性能,证明高效的单语微调可超越昂贵的多语言替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。