[论文解读] Detecting Label Errors in Token Classification Data
本文提出 worst-token 方法,通过基于任何标记的标签预测置信度最低值对句子进行评分,以检测序列标注数据集中包含标签错误的句子。该方法在 CoNLL-2003 的真实标签错误数据上评估了 11 种方法,结果表明 worst-token 在精确率-召回率表现上始终优于其他方法,尤其在结合自信心评分时效果更佳,提供了一种简单、高效且有效的解决方案,无需模型集成或复杂微调即可识别错误标注的数据。
Mislabeled examples are a common issue in real-world data, particularly for tasks like token classification where many labels must be chosen on a fine-grained basis. Here we consider the task of finding sentences that contain label errors in token classification datasets. We study 11 different straightforward methods that score tokens/sentences based on the predicted class probabilities output by a (any) token classification model (trained via any procedure). In precision-recall evaluations based on real-world label errors in entity recognition data from CoNLL-2003, we identify a simple and effective method that consistently detects those sentences containing label errors when applied with different token classification models.
研究动机与目标
- 识别在序列标注数据集中检测包含标签错误句子的有效方法。
- 在真实世界中自然发生的标签错误而非合成错误上评估标签错误检测性能。
- 开发一种基于标记级别预测置信度对整个句子进行评分的方法,以实现对错误标注样本的高效审查。
- 比较基于置信度的评分方法与基于硬预测的方法在检测标签错误方面的有效性。
- 为 NLP 数据集中的标签错误检测提供一种简单、与模型无关且计算高效的解决方案。
提出的方法
- worst-token 方法根据句子中所有标记的真值标签预测概率的最小值对句子进行评分。
- 其使用从模型输出概率中提取的每个标记的标签质量评分:自信心(p_ik)、归一化边际(p_ik - p_i~k)以及置信度加权熵(p_ik / H(p_i))。
- 句子根据 worst-token 评分进行排序,评分越低表示越可能包含至少一个错误标注的标记。
- 该方法与模型无关,可适用于任何训练好的序列分类器,仅需推理阶段的预测结果。
- 探索了 worst-token-softmin 和 worst-token-min-alt 等变体,通过考虑第二低的得分或 Confident Learning 标记来提升鲁棒性。
- 评估采用精确率-召回率、AUPRC 和 AUROC 指标,在包含自然发生错误的真实 CoNLL-2003 实体识别数据上进行。
实验结果
研究问题
- RQ1哪种标签质量评分方法在真实世界序列标注数据中能最有效地识别包含标签错误的句子?
- RQ2基于置信度的评分方法在检测标签错误方面与基于硬预测的方法相比表现如何?
- RQ3像 worst-token 这样简单且与模型无关的方法能否在标签错误检测中优于更复杂的集成方法?
- RQ4引入第二高或额外的置信度得分是否能提升对错误标注句子的检测能力?
- RQ5标签错误检测性能在不同预训练模型(如 BERT、XLM)和数据划分中如何变化?
主要发现
- 使用自信心评分的 worst-token 方法在 BERT 模型上实现了最高的 Lift@#Errors(9.02),并在所有模型和数据划分中持续优于其他方法。
- worst-token-softmin 在 Lift@#Errors 上略优于 worst-token,通过考虑第二低的标记置信度,减少了误报。
- 该方法在所有模型上 AUROC 分数均超过 0.90,表明其在识别含错误的句子方面具有强大的判别能力。
- 与自信心和归一化边际相比,置信度加权熵(cwe)表现较差,尤其在 AUPRC 和 Lift 指标上。
- worst-token-min-alt 和 worst-token-softmin 等变体仅带来微小改进,且增加了对估计误差的敏感性,因此支持使用基础 worst-token 方法。
- 本研究证实,真实世界的标签错误与合成错误存在差异,基于合成数据训练的方法可能无法有效泛化到真实数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。