[论文解读] CrossWeigh: Training Named Entity Tagger from Imperfect Annotations
本文提出 CrossWeigh,一种新颖的框架,通过检测并降低存在标签错误的训练样本权重来提升命名实体识别(NER)性能。该框架采用类似 k 折交叉验证的机制,结合实体互斥的训练划分,识别标签错误的样本,并在最终模型训练中对这些样本进行重加权。CrossWeigh 在多个数据集上显著提升了 F1 分数,包括 CoNLL03、新兴实体(emerging-entity)和低资源 NER 基准数据集,展现出强大的鲁棒性与泛化能力。
Everyone makes mistakes. So do human annotators when curating labels for named entity recognition (NER). Such label mistakes might hurt model training and interfere model comparison. In this study, we dive deep into one of the widely-adopted NER benchmark datasets, CoNLL03 NER. We are able to identify label mistakes in about 5.38% test sentences, which is a significant ratio considering that the state-of-the-art test F1 score is already around 93%. Therefore, we manually correct these label mistakes and form a cleaner test set. Our re-evaluation of popular models on this corrected test set leads to more accurate assessments, compared to those on the original test set. More importantly, we propose a simple yet effective framework, CrossWeigh, to handle label mistakes during NER model training. Specifically, it partitions the training data into several folds and train independent NER models to identify potential mistakes in each fold. Then it adjusts the weights of training data accordingly to train the final NER model. Extensive experiments demonstrate significant improvements of plugging various NER models into our proposed framework on three datasets. All implementations and corrected test set are available at our Github repo: https://github.com/ZihanWangKi/CrossWeigh.
研究动机与目标
- 识别并修正广泛使用的 CoNLL03 NER 测试集中存在的标签错误,尽管其最先进的 F1 分数已接近 93%,但仍有 5.38% 的句子存在标签错误。
- 缓解训练数据中标签错误对模型性能和评估稳定性造成的负面影响。
- 开发一种通用且可训练的框架,能够检测标签错误并提升 NER 模型的鲁棒性,而无需对模型架构进行特定修改。
- 通过发布修正后的 CoNLL03 测试集,建立更清晰的 NER 评估基准。
- 在多种 NER 场景下(包括低资源和新兴实体场景)验证该框架的有效性。
提出的方法
- 将训练数据划分为 k 个折叠(例如 10 个),确保用于某一阵营训练的模型不会使用包含该折叠中实体的训练样本。
- 在每个折叠的训练数据上独立训练一个 NER 模型,排除任何包含该折叠中实体的样本,以检测潜在的标签错误。
- 使用其余数据训练的模型对每个句子进行评分;若预测的标签分布与真实标签存在显著差异,则将其标记为潜在错误。
- 根据模型预测与真实标签之间的不一致程度,为被识别为可能标签错误的句子分配较低的训练权重。
- 使用整个训练集及实例特定的权重训练最终的 NER 模型,使潜在错误标注的影响更小。
- 该框架兼容任何支持样本加权的 NER 模型,具备广泛的架构适用性。
实验结果
研究问题
- RQ1在 CoNLL03 NER 测试集中,标签错误的普遍程度如何?当最先进的 F1 分数已达到约 93% 时,这些错误如何影响模型评估?
- RQ2能否在不依赖完美真实标签或外部知识的前提下,系统性地检测训练数据中的标签错误?
- RQ3降低潜在错误标注样本的权重是否能提升模型在多样化 NER 基准上的泛化能力并提高 F1 分数?
- RQ4与标准训练方式及其他错误检测基线相比,所提出的 CrossWeigh 框架在鲁棒性和性能提升方面表现如何?
- RQ5该框架能否有效应用于低资源和新兴实体 NER 场景,其中标注质量可能较低?
主要发现
- CoNLL03 NER 数据集中约有 5.38% 的测试句子包含标签错误,尽管报告的 F1 分数很高,但这些错误对模型评估造成了显著影响。
- 在修正后的测试集上重新评估最先进的 NER 模型,可获得更准确且稳定的性能评估结果,验证了建立更清洁基准的必要性。
- CrossWeigh 在 CoNLL03 数据集上持续提升了多种 NER 模型(包括 BiLSTM-CRF 和 BERT 基础模型)的 F1 分数,展现出稳健的性能增益。
- 该框架在新兴实体和低资源 NER 数据集上也实现了显著的性能提升,表明其泛化能力超越了标准基准。
- CrossWeigh 中的实体互斥过滤步骤至关重要——实验表明,与标准 k 折交叉验证相比,该步骤能带来可测量的性能提升。
- 框架实现与修正后的测试集已公开发布,支持可复现性及未来基准测试工作。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。