Skip to main content
QUICK REVIEW

[论文解读] Adversarial Learning with Contextual Embeddings for Zero-resource Cross-lingual Classification and NER

Phillip Keung, Yichao Lu|arXiv (Cornell University)|Aug 31, 2019
Topic Modeling参考文献 14被引用 5
一句话总结

本文提出语言对抗性训练,以在不使用平行数据或跨语言资源的情况下,利用多语言 BERT 改进零资源跨语言迁移。其中,判别器被训练以区分英语和非英语文本,而生成器(BERT)则被优化以生成语言不变的表示。该方法在 MLDoc 文本分类和 CoNLL NER 任务上显著提升了零样本性能,德国 NER 的 F1 分数最高提升 3.3 分,英语与翻译后文档嵌入之间的余弦相似度平均从 0.73 上升至 0.94。

ABSTRACT

Contextual word embeddings (e.g. GPT, BERT, ELMo, etc.) have demonstrated state-of-the-art performance on various NLP tasks. Recent work with the multilingual version of BERT has shown that the model performs very well in zero-shot and zero-resource cross-lingual settings, where only labeled English data is used to finetune the model. We improve upon multilingual BERT's zero-resource cross-lingual performance via adversarial learning. We report the magnitude of the improvement on the multilingual MLDoc text classification and CoNLL 2002/2003 named entity recognition tasks. Furthermore, we show that language-adversarial training encourages BERT to align the embeddings of English documents and their translations, which may be the cause of the observed performance gains.

研究动机与目标

  • 在不使用平行数据或跨语言资源的情况下,提升多语言 NLP 任务中的零资源跨语言迁移性能。
  • 探究语言对抗性训练是否能增强多语言 BERT 嵌入在英语与翻译文档之间的对齐能力。
  • 证明对抗性微调可超越 MLDoc 和 CoNLL NER 基准上的先前零样本基线方法。
  • 分析对抗性训练对跨语言模型性能一致性与鲁棒性的影响。
  • 探究语言不变表示是否为提升零资源迁移性能的关键驱动因素。

提出的方法

  • 训练一个语言判别器,以分类 BERT 嵌入的输入序列是否为英语。
  • 通过生成器损失优化生成器(多语言 BERT),使其生成能欺骗判别器的嵌入,从而最小化判别器区分语言的能力。
  • 整体训练目标结合了任务特定损失(如文本分类或 NER)、生成器损失和判别器损失。
  • 对抗性训练应用于在标注英语数据上的微调过程,使用未标注的非英语文本进行对抗性更新。
  • 计算英语文档及其翻译的平均池化 BERT 嵌入,通过余弦相似度衡量语义对齐程度。
  • 在英语开发集上调整超参数,并在多种语言的零资源测试集上评估模型。

实验结果

研究问题

  • RQ1对抗性训练是否能提升多语言文本分类与 NER 任务中的零资源跨语言性能?
  • RQ2语言对抗性训练在多大程度上对齐了英语文档与其非英语翻译的嵌入?
  • RQ3对抗性微调与使用跨语言资源的先前零样本基线方法相比表现如何?
  • RQ4对抗性训练是否带来跨语言性能的更高一致性和稳定性?
  • RQ5观察到的性能提升是否可归因于模型学习到更语言不变的表示?

主要发现

  • 对抗性训练在所有 MLDoc 语言的零资源文本分类任务中均提升了准确率,其中德语和日语的提升最大,准确率最高提升 5.5 个百分点。
  • 在 CoNLL 2002/2003 NER 基准上,对抗性微调使德语的 F1 分数从 68.6 提升至 71.9,西班牙语从 75.0 提升至 74.3,优于先前的零样本方法。
  • 英语文档与翻译后 BERT 嵌入之间的中位余弦相似度从无对抗性训练时的 0.73 上升至对抗性训练后的 0.94,表明对齐程度更强。
  • 性能提升在各语言间保持一致,且对抗性训练降低了训练过程中测试准确率的方差,表明收敛更稳定。
  • 即使未使用对抗性训练,多语言 BERT 的零资源性能也已超过先前发表的结果,表明其本身具备强大的零样本迁移能力。
  • 结果表明,语言对抗性训练通过促使模型学习语言不变表示,增强了跨语言泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。