Skip to main content
QUICK REVIEW

[论文解读] Can Monolingual Pretrained Models Help Cross-Lingual Classification?

Zewen Chi, Li Dong|arXiv (Cornell University)|Nov 10, 2019
Topic Modeling参考文献 17被引用 5
一句话总结

本文提出 MonoX,一种知识蒸馏与伪标签框架,通过将单语预训练模型(如 RoBERTa)的任务特定知识迁移至多语种模型(如 mBERT),实现零样本跨语言文本分类。通过使用单语教师模型生成的软标签或硬标签对多语种模型进行微调,MonoX 在原始多语种微调基础上实现显著性能提升,在 CLS 上平均准确率提高 4.91%,在 XNLI 上多个语言上提升 2.5–3.0%。

ABSTRACT

Multilingual pretrained language models (such as multilingual BERT) have achieved impressive results for cross-lingual transfer. However, due to the constant model capacity, multilingual pre-training usually lags behind the monolingual competitors. In this work, we present two approaches to improve zero-shot cross-lingual classification, by transferring the knowledge from monolingual pretrained models to multilingual ones. Experimental results on two cross-lingual classification benchmarks show that our methods outperform vanilla multilingual fine-tuning.

研究动机与目标

  • 解决在跨语言迁移学习中单语与多语预训练模型之间的性能差距。
  • 探究单语模型是否能在不依赖目标语言标注数据的情况下提升多语模型性能。
  • 开发一种知识蒸馏与伪标签框架,使多语模型能够在零样本设置下从单语模型学习。
  • 在多种语言和基准测试上评估该方法在零样本跨语言文本分类中的有效性。

提出的方法

  • 在源语言标注数据上微调单语 RoBERTa 模型,构建教师模型。
  • 使用知识蒸馏将知识从教师模型迁移至多语学生模型(mBERT),采用软标签。
  • 应用温度缩放的交叉熵损失,使学生模型的预测与教师软标签对齐。
  • 通过伪标签法增强训练数据,将教师模型对未标注源数据的高置信度预测结果赋予伪标签。
  • 使用硬标签对学生模型进行联合微调,训练数据包含标注样本与伪标签样本。
  • 在联合数据集上使用标准交叉熵损失优化学生模型,实现对目标语言的零样本迁移。

实验结果

研究问题

  • RQ1单语预训练模型能否提升多语模型在零样本跨语言分类任务中的性能?
  • RQ2从单语教师模型进行知识蒸馏是否能提升低资源目标语言的泛化能力?
  • RQ3使用单语教师模型生成的伪标签数据如何影响多语学生模型的性能?
  • RQ4所提出方法对超参数(如蒸馏温度)的敏感性如何?
  • RQ5单语教师模型带来的性能增益是否在不同数据规模和 NLP 任务中均持续存在?

主要发现

  • 在零样本跨语言情感分类的 CLS 基准上,MonoX 相较于原始多语微调方法,平均准确率提升 4.91%。
  • MonoX-Pl 与 MonoX-Kd 在 XNLI 上分别取得 72.1% 和 72.0% 的平均准确率,而 mBERT 为 68.6%,表明在多种语言中均实现稳定提升。
  • 即使仅使用 10% 的训练数据,该方法仍能提升性能,数据稀缺时在 XNLI 上最高提升达 3.0%。
  • 使用 0.1 的温度进行知识蒸馏效果最佳,且在广泛温度范围内均表现稳健。
  • mBert-St(使用未标注数据但无知识蒸馏)仅较 mBERT 有微小提升,证实 MonoX 的性能增益源于知识迁移,而非单纯的数据增强。
  • 单语教师模型不仅提升了源语言性能,也显著改善了零样本目标语言的性能,证明了有效的跨语言知识迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。