Skip to main content
QUICK REVIEW

[论文解读] Consistency Regularization for Cross-Lingual Fine-Tuning

Bo Zheng, Li Dong|arXiv (Cornell University)|Jun 15, 2021
Topic Modeling参考文献 35被引用 5
一句话总结

本文提出 xTune,一种跨语言微调框架,通过结合四种数据增强策略(子词采样、代码切换替换、高斯噪声、机器翻译)实施一致性正则化,显著提升 XTREME 基准测试中多个自然语言处理任务的迁移性能,尤其在低资源设置下表现突出。

ABSTRACT

Fine-tuning pre-trained cross-lingual language models can transfer task-specific supervision from one language to the others. In this work, we propose to improve cross-lingual fine-tuning with consistency regularization. Specifically, we use example consistency regularization to penalize the prediction sensitivity to four types of data augmentations, i.e., subword sampling, Gaussian noise, code-switch substitution, and machine translation. In addition, we employ model consistency to regularize the models trained with two augmented versions of the same training set. Experimental results on the XTREME benchmark show that our method significantly improves cross-lingual fine-tuning across various tasks, including text classification, question answering, and sequence labeling.

研究动机与目标

  • 通过更有效地利用数据增强,提升微调中的跨语言迁移性能。
  • 解决传统微调方法中将增强样本独立处理、未强制一致性的问题。
  • 开发一种灵活、即插即用的方法,适用于多种下游任务,如分类、跨度抽取和序列标注。
  • 通过强制在语言变体和模型变体之间保持一致性,提升模型泛化能力,尤其针对低资源语言。
  • 证明一致性正则化可带来更优的决策边界和更具语言不变性的表征。

提出的方法

  • 引入样本一致性正则化(R₁),通过惩罚输入与其语义等价增强版本(如翻译或代码切换变体)之间的预测方差,实现一致性约束。
  • 应用模型一致性正则化(R₂),对同一训练集不同增强版本所训练的两个模型的预测结果进行对齐,促进语料级一致性。
  • 采用四种数据增强策略:子词采样、代码切换替换、嵌入空间的高斯噪声,以及通过机器翻译实现跨语言数据扩展。
  • 将 R₁ 和 R₂ 统一整合到联合训练目标中,同时对增强样本间的预测和模型行为进行正则化。
  • 使用共享编码器与共享参数处理不同增强视图,支持端到端训练并施加一致性约束。
  • 通过模型一致性正则化支持半监督学习,利用未标注的目标语言翻译数据提升性能。

实验结果

研究问题

  • RQ1将一致性正则化应用于数据增强样本时,能否提升跨语言迁移性能?
  • RQ2在原始输入与增强输入之间强制预测一致性,是否能提升跨语言的泛化能力?
  • RQ3通过使在不同增强数据集上训练的模型预测结果对齐,模型一致性正则化如何影响性能?
  • RQ4即使缺乏专用翻译系统或双语词典,该方法是否仍能提升低资源语言的性能?
  • RQ5一致性正则化是否能生成更具语言不变性的表征并改善决策边界?

主要发现

  • xTune 在 XTREME 基准测试中,平均将 XLM-R large 基线提升 +2.2 分,低资源语言(如乌尔都语)最高提升 +5.4 分。
  • 在 POS 任务中,标签对齐困难,xTune 在代码切换增强下仍实现 +2.6 分的性能提升,而传统微调结合数据增强反而导致性能下降 1.2 分。
  • 仅使用样本一致性正则化(R₁)即可显著提升跨语言检索性能,表明其有助于学习更具语言不变性的表征。
  • t-SNE 可视化结果证实,xTune 生成了更紧凑、更易分离的决策边界,且语义等价的跨语言样本表征更加相似。
  • 模型一致性正则化使未标注目标语言翻译数据的半监督训练更加有效,无需黄金标签即可提升性能。
  • 该方法在多种任务中均表现灵活且高效,包括文本分类、问答和序列标注,在所有评估设置中均取得一致性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。