Skip to main content
QUICK REVIEW

[论文解读] CROP: Zero-shot Cross-lingual Named Entity Recognition with Multilingual Labeled Sequence Translation

Jian Yang, Shaohan Huang|arXiv (Cornell University)|Oct 13, 2022
Topic Modeling被引用 4
一句话总结

该论文提出 CroP,一种零样本跨语言命名实体识别框架,通过多语言带标签序列翻译,将高资源语言的知识迁移至低资源语言。通过将目标语句翻译至源语言,使用源语言命名实体识别模型进行标注,并通过标签投影进行反向翻译,CroP 实现了最先进性能,在 XTREME-40 和 CoNLL-5 基准测试中相比强基线模型 F1 分数提升 3–7 个百分点。

ABSTRACT

Named entity recognition (NER) suffers from the scarcity of annotated training data, especially for low-resource languages without labeled data. Cross-lingual NER has been proposed to alleviate this issue by transferring knowledge from high-resource languages to low-resource languages via aligned cross-lingual representations or machine translation results. However, the performance of cross-lingual NER methods is severely affected by the unsatisfactory quality of translation or label projection. To address these problems, we propose a Cross-lingual Entity Projection framework (CROP) to enable zero-shot cross-lingual NER with the help of a multilingual labeled sequence translation model. Specifically, the target sequence is first translated into the source language and then tagged by a source NER model. We further adopt a labeled sequence translation model to project the tagged sequence back to the target language and label the target raw sentence. Ultimately, the whole pipeline is integrated into an end-to-end model by the way of self-training. Experimental results on two benchmarks demonstrate that our method substantially outperforms the previous strong baseline by a large margin of +3~7 F1 scores and achieves state-of-the-art performance.

研究动机与目标

  • 解决因低资源语言标注训练数据稀缺而导致的低资源命名实体识别挑战。
  • 克服现有跨语言命名实体识别方法依赖弱翻译或标签投影所带来的性能下降问题。
  • 利用未标注的目标语言语料库,通过将自训练整合到往返翻译流程中,提升知识迁移效果。
  • 利用具有短语级对齐的多语言序列翻译,在语言差异较大的语言之间实现有效的零样本迁移。
  • 开发一个结合多语言翻译、命名实体识别标注与标签投影的端到端鲁棒框架,实现完整的跨语言命名实体识别。

提出的方法

  • 使用多语言翻译模型将未标注的目标语言句子翻译为源语言。
  • 使用预训练的源语言命名实体识别模型对翻译后的源语言句子进行标注,生成伪标签序列。
  • 使用多语言带标签序列翻译模型将标注后的源语言序列反向翻译回目标语言,同时保留实体标签。
  • 通过词级对齐上的词汇匹配,将反向翻译序列中的实体标签投影到原始的未处理目标句子中。
  • 将整个流程整合为端到端模型,通过自训练优化预测结果并提升鲁棒性。
  • 在带有边界标记对齐短语的多语言平行语料上训练带标签序列翻译模型,同时借助短语级对齐信息进行指导。

实验结果

研究问题

  • RQ1多语言带标签序列翻译模型是否能在零样本设置下,有效实现从高资源语言到低资源语言的命名实体识别知识迁移?
  • RQ2往返翻译与标签投影流程在跨语言命名实体识别中,相较于直接迁移或标准数据迁移方法,表现如何?
  • RQ3该方法在目标语言无任何标注数据的情况下,对语言差异较大的语言对的泛化能力如何?
  • RQ4与静态流程相比,自训练在端到端 CroP 框架中如何提升性能?
  • RQ5使用短语级对齐和多语言平行数据对标签投影质量及最终命名实体识别性能有何影响?

主要发现

  • CroP 在 XTREME-40(40 种语言)和 CoNLL-5(5 种语言)基准测试中均达到最先进性能,相比强基线模型 F1 分数提升 3–7 个百分点。
  • 在 XTREME-40 上平均 F1 得分为 79.8,在 CoNLL-5 上为 53.8,尤其在语言差异较大的语言对中提升显著,表明实现了有效的跨语言知识迁移。
  • 与非自训练变体相比,自训练使性能平均提升 1.2 个 F1 分数,证明了迭代优化的有效性。
  • 多语言带标签序列翻译模型显著提升了标签投影的准确性,尤其是在使用对齐短语和短语级对齐信息时。
  • 通过词汇匹配实现的实体匹配在 90% 的情况下成功将标签投影到原始句子中(当反向翻译句与原句逐词匹配时),有效降低了伪标签中的噪声。
  • 该框架在语言差异较大的语言对(如英语到日语或中文)中仍保持强劲性能,表明其在不同语系中的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。