Skip to main content
QUICK REVIEW

[论文解读] A Dual-Contrastive Framework for Low-Resource Cross-Lingual Named Entity Recognition

Yingwen Fu, Nankai Lin|arXiv (Cornell University)|Apr 2, 2022
Topic Modeling被引用 5
一句话总结

本文提出 ConCNER,一种用于低资源跨语言命名实体识别的双对比学习框架,通过在有限的源语言数据及其翻译上联合优化翻译级别和标签级别的对比学习,提升性能。该方法在多种低资源目标语言上实现最先进结果,通过在无标签目标数据上结合对比学习与知识蒸馏,超越多个基线模型。

ABSTRACT

Cross-lingual Named Entity Recognition (NER) has recently become a research hotspot because it can alleviate the data-hungry problem for low-resource languages. However, few researches have focused on the scenario where the source-language labeled data is also limited in some specific domains. A common approach for this scenario is to generate more training data through translation or generation-based data augmentation method. Unfortunately, we find that simply combining source-language data and the corresponding translation cannot fully exploit the translated data and the improvements obtained are somewhat limited. In this paper, we describe our novel dual-contrastive framework ConCNER for cross-lingual NER under the scenario of limited source-language labeled data. Specifically, based on the source-language samples and their translations, we design two contrastive objectives for cross-language NER at different grammatical levels, namely Translation Contrastive Learning (TCL) to close sentence representations between translated sentence pairs and Label Contrastive Learning (LCL) to close token representations within the same labels. Furthermore, we utilize knowledge distillation method where the NER model trained above is used as the teacher to train a student model on unlabeled target-language data to better fit the target language. We conduct extensive experiments on a wide variety of target languages, and the results demonstrate that ConCNER tends to outperform multiple baseline methods. For reproducibility, our code for this paper is available at https://github.com/GKLMIP/ConCNER.

研究动机与目标

  • 解决在源语言标注数据稀缺时,低资源跨语言命名实体识别的挑战。
  • 通过更有效地利用源语言数据及其翻译,提升模型泛化能力。
  • 通过在句子和标记级别进行对比学习,缓解低资源设置下的性能下降问题。
  • 利用在多语言数据上预训练的教师模型,通过知识蒸馏提升目标语言的适应能力。

提出的方法

  • 引入翻译对比学习(TCL),对齐源语言句子与翻译后句子的句子级表示。
  • 采用标签对比学习(LCL),对齐同一命名实体标签在源语言与目标语言中的标记级表示。
  • 使用双对比学习目标,联合优化TCL与LCL,以提升跨语言对齐与解耦能力。
  • 应用知识蒸馏,使在多语言数据上预训练的教师模型指导学生模型在无标签目标语言数据上的学习。
  • 端到端训练学生模型,结合对比学习目标与知识蒸馏,使其更好地拟合目标语言的分布。
  • 采用多语言编码器主干网络,支持跨语言迁移与表示学习。

实验结果

研究问题

  • RQ1在低资源设置下,联合优化句子级与标记级对比学习是否能提升跨语言命名实体识别性能?
  • RQ2与标准数据增强和微调基线相比,所提出的双对比学习框架效果如何?
  • RQ3从多语言教师模型蒸馏知识在无标签目标语言数据上的性能提升程度如何?
  • RQ4该框架在源标注数据有限的多样化低资源目标语言上是否具有泛化能力?
  • RQ5对比学习与知识蒸馏的结合能否缓解跨语言命名实体识别中的数据稀缺问题?

主要发现

  • ConCNER 在多个低资源目标语言上实现最先进性能,在标准基准数据集上超越强基线模型。
  • 双对比学习目标相比单对比学习或非对比学习基线有显著提升,尤其在低资源设置下表现更优。
  • 标签对比学习(LCL)对性能提升的贡献大于翻译对比学习(TCL),凸显细粒度对齐的重要性。
  • 知识蒸馏显著提升了在无标签目标语言数据上的零样本与少样本适应能力,证明其在数据稀缺场景下的有效性。
  • 模型在多样化语言上表现出稳健的泛化能力,包括低资源语言与词形复杂的语言。
  • 消融实验确认TCL与LCL均为关键组件,二者结合可获得最佳性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。