[论文解读] Cross-Lingual Named Entity Recognition Using Parallel Corpus: A New Approach Using XLM-RoBERTa Alignment
本文提出了一种新颖的零样本跨语言命名实体识别方法,利用 XLM-RoBERTa 将英文平行句中的实体对齐至目标语言,从而在无需翻译的情况下生成高质量的伪标签训练数据。该方法通过多语言表示学习和一种重加权损失函数缓解噪声标签的影响,在四种语言上均取得了具有竞争力的 F1 分数,优于以往的无监督模型。
We propose a novel approach for cross-lingual Named Entity Recognition (NER) zero-shot transfer using parallel corpora. We built an entity alignment model on top of XLM-RoBERTa to project the entities detected on the English part of the parallel data to the target language sentences, whose accuracy surpasses all previous unsupervised models. With the alignment model we can get pseudo-labeled NER data set in the target language to train task-specific model. Unlike using translation methods, this approach benefits from natural fluency and nuances in target-language original corpus. We also propose a modified loss function similar to focal loss but assigns weights in the opposite direction to further improve the model training on noisy pseudo-labeled data set. We evaluated this proposed approach over 4 target languages on benchmark data sets and got competitive F1 scores compared to most recent SOTA models. We also gave extra discussions about the impact of parallel corpus size and domain on the final transfer performance.
研究动机与目标
- 为解决多语言命名实体识别的高标注成本问题,通过平行语料库实现零样本迁移。
- 克服基于翻译的方法在词级对齐中因流畅性与结构不匹配带来的局限性。
- 利用 XLM-RoBERTa 强大的多语言表征能力实现端到端的实体对齐,无需手工特征。
- 通过一种新颖的重加权损失函数提升在噪声伪标签数据上的训练鲁棒性。
- 评估平行语料库的领域与规模对跨语言命名实体识别迁移性能的影响。
提出的方法
- 在英文标注数据上训练命名实体识别模型,随后将其应用于平行语料库的英文侧以生成实体预测。
- 利用 XLM-RoBERTa 对跨语言对中的检测实体进行对齐,将标签从英文投影至目标语言。
- 利用平行句中对齐的实体跨度,在目标语言中构建伪标注的命名实体识别数据集。
- 在伪标注的目标语言数据上微调多语言模型(如 mBERT 或 XLM-R),使用修改后的损失函数。
- 引入一种受焦点损失启发的重加权损失函数,但采用反向加权策略以降低困难样本的影响,减少噪声干扰。
- 结合多个领域的平行数据(如新闻、字幕、维基百科)以提升泛化能力并应对实体分布偏移问题。
实验结果
研究问题
- RQ1基于 XLM-RoBERTa 的对齐方法是否能在零样本跨语言命名实体识别中超越以往的无监督或启发式方法?
- RQ2所提出的重加权损失函数如何改善在噪声伪标签数据上的模型收敛性与性能?
- RQ3平行语料库的领域在多大程度上影响了迁移命名实体识别模型的质量?
- RQ4结合多个平行语料库领域是否能获得优于单一领域数据的平均性能?
- RQ5平行数据的规模与领域多样性在低资源语言上的迁移性能中起到何种影响?
主要发现
- 所提方法在四种目标语言上取得了具有竞争力的 F1 分数,优于所有先前的无监督模型,在零样本跨语言命名实体识别中表现卓越。
- 在 CoNLL2002 德语命名实体识别基准上,该方法通过顺序微调与重加权损失,取得了 74.6 的 F1 分数,优于零迁移(F1=72.1)与标准交叉熵微调(F1=72.7)。
- 多个平行语料库领域(如新闻、字幕、维基百科)的组合在测试集上实现了最佳平均性能,优于单一领域数据。
- 新闻领域平行数据在 People’s Daily 测试集上表现最佳,与领域相似性一致;而 OpenSubtitles 在正式文本上表现较差,原因在于实体密度与风格不匹配。
- 消融实验证实,英文预训练与在伪标注目标数据上的微调均不可或缺,且重加权损失在顺序训练中表现更优。
- 在混合英文与伪标注德语数据上同时训练,且使用重加权损失时性能较差,可能是因为目标语言数据中噪声暴露更高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。