[论文解读] AdvPicker: Effectively Leveraging Unlabeled Data via Adversarial Discriminator for Cross-Lingual NER
AdvPicker 提出了一种用于跨语言命名实体识别的新型对抗性数据选择框架,通过训练判别器来识别语言无关的高质量伪标签样本,从而利用未标注的目标语言数据。通过结合对抗性训练与知识蒸馏,该方法在不依赖翻译模型或名录等外部资源的情况下,超越了当前最先进方法。
Neural methods have been shown to achieve high performance in Named Entity Recognition (NER), but rely on costly high-quality labeled data for training, which is not always available across languages. While previous works have shown that unlabeled data in a target language can be used to improve cross-lingual model performance, we propose a novel adversarial approach (AdvPicker) to better leverage such data and further improve results. We design an adversarial learning framework in which an encoder learns entity domain knowledge from labeled source-language data and better shared features are captured via adversarial training - where a discriminator selects less language-dependent target-language data via similarity to the source language. Experimental results on standard benchmark datasets well demonstrate that the proposed method benefits strongly from this data selection process and outperforms existing state-of-the-art methods; without requiring any additional external resources (e.g., gazetteers or via machine translation). The code is available at https://aka.ms/AdvPicker
研究动机与目标
- 通过利用未标注的目标语言数据,解决低资源语言中低资源命名实体识别的挑战。
- 克服现有伪标签方法的局限性——即假设所有伪标签数据均有益,这可能导致噪声和语言特异性偏差。
- 通过对抗性学习仅选择语言无关的高质量伪标签样本,提升跨语言迁移性能。
- 开发一种结合基于特征的方法与伪标签方法的框架,且不依赖昂贵的外部资源(如机器翻译或平行语料)
提出的方法
- 使用 token 级别的对抗性训练微调源语言 NER 模型(mBERT),以学习语言不变的表示。
- 训练一个语言判别器,以区分源语言与目标语言的 token 级别表示,促使编码器最小化语言特异性特征。
- 利用预训练的编码器在未标注的目标语言数据上生成伪标签。
- 应用训练好的判别器,仅从目标语言中筛选出最具语言无关性(即类似源语言)的伪标签样本。
- 在所选的高质量伪标签数据上,通过知识蒸馏训练最终的目标语言 NER 模型。
- 采用软标签蒸馏策略,使学生模型在多个具有不同随机种子的教师模型的预测结果上进行训练,以提升鲁棒性。
实验结果
研究问题
- RQ1对抗性训练能否有效从跨语言命名实体识别的未标注目标语言数据中识别出语言无关的高质量伪标签样本?
- RQ2仅选择语言无关的伪标签数据是否能相比使用全部伪标签数据,提升模型的泛化能力与性能?
- RQ3所提出的方法是否能在不依赖翻译模型或名录等外部资源的情况下,实现在零样本跨语言命名实体识别任务中的最先进性能?
- RQ4对抗性数据选择机制如何影响模型在多个随机种子下的稳定性与鲁棒性?
主要发现
- AdvPicker 在三个目标语言(德语、西班牙语、荷兰语)的标准基准数据集上均取得了新的最先进 F1 分数,相比之前最先进方法最高提升达 1.5–2.0 F1 分点。
- 语言无关数据的平均 F1 分数比语言特异性数据高出 12.87 分,证实了所选样本的质量。
- 即使在‘其他’(未选中)数据划分上进行评估,AdvPicker 仍优于所有基线模型,表明其泛化能力不仅限于所选数据分布。
- 消融实验证明,对所选数据进行知识蒸馏能显著提升性能,而使用全部伪标签数据则导致性能下降,验证了选择性数据使用的重要性。
- AdvPicker 在五个随机种子下的 F1 分数标准差低于 mBERT-ft 和 UniTrans,表明其训练稳定性更高。
- 该方法在所有目标语言上均实现一致的性能提升,且在更大数据集(如德语和荷兰语)上提升更显著,表明其可扩展至更高资源的目标语言。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。