[论文解读] Single-/Multi-Source Cross-Lingual NER via Teacher-Student Learning on Unlabeled Data in Target Language
本文提出了一种用于单源和多源跨语言命名实体识别的教师-学生蒸馏框架,该框架利用未标注的目标语言数据,而无需依赖已标注的源语言数据,结合多语言 BERT 和软标签监督。该方法通过有效的知识迁移,将源语言模型的知识传递给在未标注目标数据上训练的学生模型,在多源设置中通过基于语言相似度的加权机制进一步提升了性能,优于当前最先进方法。
To better tackle the named entity recognition (NER) problem on languages with little/no labeled data, cross-lingual NER must effectively leverage knowledge learned from source languages with rich labeled data. Previous works on cross-lingual NER are mostly based on label projection with pairwise texts or direct model transfer. However, such methods either are not applicable if the labeled data in the source languages is unavailable, or do not leverage information contained in unlabeled data in the target language. In this paper, we propose a teacher-student learning method to address such limitations, where NER models in the source languages are used as teachers to train a student model on unlabeled data in the target language. The proposed method works for both single-source and multi-source cross-lingual NER. For the latter, we further propose a similarity measuring method to better weight the supervision from different teacher models. Extensive experiments for 3 target languages on benchmark datasets well demonstrate that our method outperforms existing state-of-the-art methods for both single-source and multi-source cross-lingual NER.
研究动机与目标
- 解决现有跨语言命名实体识别方法依赖已标注源语言数据或忽略未标注目标语言数据的局限性。
- 在目标语言无任何标注数据的低资源设置下,实现有效的知识迁移。
- 开发一种利用未标注目标语言数据的方法,同时避免对已标注源语言数据的依赖。
- 通过引入基于语言相似度的加权机制,改进多源跨语言命名实体识别中多个教师模型的监督。
- 验证在低资源命名实体识别中,软标签蒸馏相较于硬标签或直接模型迁移的有效性。
提出的方法
- 使用基于多语言 BERT 的模型,为源语言和目标语言提取语言无关的上下文表示。
- 预训练的源语言命名实体识别模型作为教师模型,为未标注目标语言句子中的词元生成软标签分布(概率向量)。
- 学生命名实体识别模型基于这些软标签在伪标注的目标数据上进行训练,实现无需已标注源数据的知识蒸馏。
- 在多源命名实体识别中,提出一种基于语言识别的相似度度量方法,用于计算每个源语言与目标语言之间的相关性,并用于加权教师监督。
- 该相似度度量通过句子嵌入和语言识别分类器计算,替代标准的余弦或 ℓ₂ 距离度量。
- 该方法在伪标注的目标数据上端到端训练,使用交叉熵损失,其中软标签提供了比硬标签更丰富的监督信号。
实验结果
研究问题
- RQ1是否能够有效实现从源语言命名实体识别模型到目标语言学生模型的知识迁移,而无需使用源语言的标注数据?
- RQ2在未标注目标数据上使用教师模型生成的软标签,相较于硬标签或直接模型迁移,如何提升命名实体识别性能?
- RQ3基于语言识别的相似度度量是否能通过更优地加权多个源语言的监督信号,改善多源跨语言命名实体识别?
- RQ4所提出的方法是否在单源和多源跨语言命名实体识别设置中均优于现有最先进方法?
- RQ5为何教师-学生学习能够纠正源模型的误预测,特别是在低置信度区域?
主要发现
- 所提方法在 3 种目标语言(es, nl, de)的基准数据集上达到最先进性能,在单源和多源设置中均优于现有方法。
- 使用软标签而非硬标签可带来一致的 F1 分数提升,使用硬标签时性能下降最高达 1.46 F1。
- 直接模型迁移(MT-*)的性能显著劣于所提蒸馏方法,证明了利用未标注目标数据的优势。
- 将所提语言相似度度量替换为余弦或 ℓ₂ 距离时,所有目标语言的性能均出现一致下降,验证了其有效性。
- 该方法能纠正更高比例的教师模型低置信度误预测,表明学生模型的决策边界学习得到改善。
- 案例研究显示,学生模型能从未标注目标数据中频繁出现的高概率预测中学习特定词汇的标签偏好(例如 'EFE' 作为 ORG),从而提升对模糊词元的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。