Skip to main content
QUICK REVIEW

[论文解读] Exploring Fine-tuning Techniques for Pre-trained Cross-lingual Models via Continual Learning

Zihan Liu, Genta Indra Winata|arXiv (Cornell University)|Apr 29, 2020
Topic Modeling参考文献 30被引用 17
一句话总结

本文提出一种使用梯度情景记忆(GEM)的持续学习方法,以在微调过程中保持 mBERT 和 XLM-R 等预训练多语言模型的跨语言能力。通过使用掩码语言建模(MLM)和跨语言句子检索(XSR)任务对微调过程进行约束,该方法可防止灾难性遗忘,并在跨语言词性标注(POS)和命名实体识别(NER)任务上实现最先进(SOTA)的零样本性能,平均优于标准微调基线超过 1%。

ABSTRACT

Recently, fine-tuning pre-trained language models (e.g., multilingual BERT) to downstream cross-lingual tasks has shown promising results. However, the fine-tuning process inevitably changes the parameters of the pre-trained model and weakens its cross-lingual ability, which leads to sub-optimal performance. To alleviate this problem, we leverage continual learning to preserve the original cross-lingual ability of the pre-trained model when we fine-tune it to downstream tasks. The experimental result shows that our fine-tuning methods can better preserve the cross-lingual ability of the pre-trained model in a sentence retrieval task. Our methods also achieve better performance than other fine-tuning baselines on the zero-shot cross-lingual part-of-speech tagging and named entity recognition tasks.

研究动机与目标

  • 解决在微调过程中预训练多语言模型出现灾难性遗忘的问题,该问题会降低其跨语言性能。
  • 在对源语言下游任务进行微调后,保留 mBERT 和 XLM-R 等模型原有的跨语言能力。
  • 探究是否可通过辅助任务(MLM 和 XSR)的持续学习,在微调过程中保持跨语言对齐。
  • 提升在词性标注和命名实体识别任务上的零样本跨语言迁移性能。

提出的方法

  • 该方法采用梯度情景记忆(GEM),一种持续学习框架,通过存储先前任务的经验作为记忆形式。
  • 将微调建模为带有不等式约束的优化问题,以确保先前任务(MLM 或 XSR)的性能不会下降。
  • 在微调下游任务(如 POS 或 NER)的同时,通过正则化保持 MLM 和 XSR 任务的性能。
  • 情景记忆存储来自 MLM 和 XSR 任务的代表性样本,以在训练期间施加约束。
  • 在联合训练设置中同时使用 MLM 和 XSR 目标,以更好地保持跨语言泛化能力。
  • 该方法应用于 mBERT 和 XLM-R,并通过消融实验比较在英语仅用与全部语言下进行辅助任务训练的效果。

实验结果

研究问题

  • RQ1使用 GEM 的持续学习是否能保留预训练多语言模型在源语言任务微调过程中的跨语言能力?
  • RQ2与标准微调相比,通过 MLM 和 XSR 任务约束微调是否能带来更好的 POS 和 NER 任务上的零样本跨语言迁移性能?
  • RQ3性能提升是由于同时使用 MLM 和 XSR 约束所致,还是单一约束已足够?
  • RQ4在辅助任务 MLM 中选择的语言(仅英语 vs. 全部语言)如何影响最终性能和泛化能力?
  • RQ5仅在 XSR 上进行微调是否能带来比标准微调更好的跨语言性能,还是会导致灾难性遗忘?

主要发现

  • 同时使用 MLM 和 XSR 约束的 GEM 方法在 POS 和 NER 任务上实现了最佳的零样本跨语言性能,平均优于标准微调基线超过 1%。
  • GEM w/ Both (MLM 和 XSR) 在 POS 上达到 86.8% 的平均 F1,在 NER 上达到 75.5%,显著优于基线的朴素微调方法。
  • 在 MLM 或 XSR 任务上使用 MTF(多任务微调)进行微调,其下游性能反而劣于朴素微调,表明对辅助任务存在过拟合。
  • 使用 GEM 对 MLM 任务中所有语言进行约束,其性能略低于仅使用英语,表明过度约束可能阻碍泛化。
  • GEM 方法在微调后仍保持较强的跨语言句子检索(XSR)性能,而标准微调导致 XSR 准确率显著下降。
  • 消融实验确认,GEM w/ MLM (all) 和 GEM w/ XSR (all) 均能提升跨语言性能,但两者结合可获得最佳结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。