Skip to main content
QUICK REVIEW

[论文解读] CoSDA-ML: Multi-Lingual Code-Switching Data Augmentation for Zero-Shot Cross-Lingual NLP

Libo Qin, Minheng Ni|arXiv (Cornell University)|Jun 11, 2020
Topic Modeling参考文献 18被引用 11
一句话总结

该论文提出 CoSDA-ML,一种数据增强框架,通过使用双语词典将英语源文本与多种目标语言的翻译动态混合,生成多语言混编句子。该方法在单次训练过程中微调 mBERT,以对齐 19 种语言之间的上下文表征,相较于 mBERT 和 XLM 在五个零样本跨语言 NLP 任务上取得显著性能提升,且仅使用 1/10 的英语训练数据。

ABSTRACT

Multi-lingual contextualized embeddings, such as multilingual-BERT (mBERT), have shown success in a variety of zero-shot cross-lingual tasks. However, these models are limited by having inconsistent contextualized representations of subwords across different languages. Existing work addresses this issue by bilingual projection and fine-tuning technique. We propose a data augmentation framework to generate multi-lingual code-switching data to fine-tune mBERT, which encourages model to align representations from source and multiple target languages once by mixing their context information. Compared with the existing work, our method does not rely on bilingual sentences for training, and requires only one training process for multiple target languages. Experimental results on five tasks with 19 languages show that our method leads to significantly improved performances for all the tasks compared with mBERT.

研究动机与目标

  • 解决 mBERT 等多语言模型中跨语言上下文子词表征不一致的问题。
  • 在不依赖平行训练数据或为每种目标语言单独训练模型的前提下,提升零样本跨语言迁移性能。
  • 实现在单次微调过程中对源语言和多种目标语言表征的联合对齐。
  • 开发一种灵活、动态的数据增强方法,以增强 mBERT 在多种低资源语言上的跨语言泛化能力。

提出的方法

  • 通过随机选择英语句子,并使用双语词典将选定的词元替换为多种目标语言的翻译,构建混编句子。
  • 替换操作在每个训练批次中动态执行,确保每个训练周期内不同语言组合的混编数据具有多样性。
  • 该框架仅使用单语句子和双语词典,避免依赖平行句子对来生成数据。
  • 将增强后的数据用于微调 mBERT,促使模型隐式对齐源语言与多种目标语言之间的词表征。
  • 该方法兼容任何基础编码器模型,不仅限于 mBERT,经 BiLSTM 实验验证其通用性。
  • 该方法利用共享子词分词和上下文注意力机制,在共享嵌入空间中对齐跨语言的表征。

实验结果

研究问题

  • RQ1动态多语言混编数据增强是否能提升在多种语言上的零样本跨语言迁移性能?
  • RQ2所提方法是否能在不使用平行句子的前提下,实现优于 mBERT 的跨语言表征对齐?
  • RQ3单次微调过程能否有效同时对齐源语言与多种目标语言的表征?
  • RQ4该数据增强框架是否在 mBERT 之外也有效,例如在非预训练编码器(如 BiLSTM)上?

主要发现

  • CoSDA-ML 在五个零样本跨语言 NLP 任务上显著优于 mBERT 和 XLM 基线模型,包括自然语言蕴涵、情感分类、文档分类、自然语言理解以及对话状态追踪。
  • 在多个任务上,CoSDA-ML 仅使用 1/10 的英语训练数据即达到最先进性能,展现出强大的数据效率。
  • 对 [CLS] 词元向量的可视化显示,经过 CoSDA-ML 微调后,相同意图在不同语言中的表征在嵌入空间中更加接近并发生重叠,表明实现了有效的跨语言对齐。
  • 该方法在 19 种语言上均实现一致的性能提升,证实其在多语言环境下的可扩展性与鲁棒性。
  • 当应用于 BiLSTM 时,CoSDA-ML 在所有语言和指标上仍优于基线模型,证明其在基于 Transformer 的模型之外也具有有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。