Skip to main content
QUICK REVIEW

[论文解读] Automatic Noisy Label Correction for Fine-Grained Entity Typing

Weiran Pan, Wei Wei|arXiv (Cornell University)|May 6, 2022
Topic Modeling被引用 5
一句话总结

该论文提出了一种新颖的、无需资源的自动方法,用于校正细粒度实体类型识别(FET)中的噪声标签。该方法通过从模型logits估计后验概率来识别模糊标签,然后在清洗后的数据上重新训练。该方法在两个基准测试上提升了FET性能,无需依赖层级类型结构或人工标注子集,通过稳健的标签校正实现了最先进结果。

ABSTRACT

Fine-grained entity typing (FET) aims to assign proper semantic types to entity mentions according to their context, which is a fundamental task in various entity-leveraging applications. Current FET systems usually establish on large-scale weakly-supervised/distantly annotation data, which may contain abundant noise and thus severely hinder the performance of the FET task. Although previous studies have made great success in automatically identifying the noisy labels in FET, they usually rely on some auxiliary resources which may be unavailable in real-world applications (e.g. pre-defined hierarchical type structures, human-annotated subsets). In this paper, we propose a novel approach to automatically correct noisy labels for FET without external resources. Specifically, it first identifies the potentially noisy labels by estimating the posterior probability of a label being positive or negative according to the logits output by the model, and then relabel candidate noisy labels by training a robust model over the remaining clean labels. Experiments on two popular benchmarks prove the effectiveness of our method. Our source code can be obtained from https://github.com/CCIIPLab/DenoiseFET.

研究动机与目标

  • 解决细粒度实体类型识别(FET)中噪声标签带来的挑战,这些噪声标签严重损害模型性能。
  • 开发一种不依赖辅助资源(如层级类型结构或人工标注子集)的噪声标签校正方法。
  • 通过检测与预期后验概率偏离的“模糊标签”,识别潜在的噪声标签。
  • 通过两阶段流程(噪声标签检测与在清洗数据上的重新训练)提升FET模型的鲁棒性与性能。
  • 在广泛使用的FET基准(如Ultra-Fine和OntoNotes)上验证该方法的有效性。

提出的方法

  • 该方法利用预训练FET模型的logits,估计标签为正或负的后验概率,并将这些概率分别拟合到正样本和负样本的两个高斯分布中。
  • 通过测量原始标注与估计后验概率之间的不一致程度,识别潜在的噪声标签,选择一致性较低的标签。
  • 将识别出的噪声标签视为未标注数据,对剩余的清洁标签采用半监督学习策略进行模型微调。
  • 在微调过程中引入熵正则化,促使模型对重新标注的噪声样本做出更自信的预测。
  • 该方法以单次遍历的方式迭代执行,避免了大规模FET数据集难以承受的多轮训练。
  • 包含一个过滤步骤,用于移除明显错误的噪声标签(异常值),以防止其在长尾类型分布中扭曲似然估计。

实验结果

研究问题

  • RQ1能否在不依赖外部资源(如层级类型结构或人工标注子集)的情况下校正细粒度实体类型识别中的噪声标签?
  • RQ2如何有效识别并分离导致模型不确定性的“模糊标签”?
  • RQ3校正噪声标签在标准基准测试上对FET模型性能的提升程度如何?
  • RQ4与现有去噪技术相比,该方法在鲁棒性和泛化能力方面表现如何?
  • RQ5过滤极端异常值并应用熵正则化对标签校正效果有何影响?

主要发现

  • 当未过滤明显噪声标签时,该方法在Ultra-Fine数据集上实现了Macro-F1提升0.5%,凸显了在长尾设置下移除异常值的重要性。
  • 熵正则化在所有数据集上均显著提升性能,表明在重新标注数据上进行半监督微调可增强模型泛化能力。
  • 该方法优于在原始噪声数据上训练的基线模型,去噪后提及嵌入的T-SNE可视化显示决策边界更清晰。
  • 案例研究显示,该方法成功恢复了缺失的细粒度类型,并去除了错误的正样本标签,生成了更准确、更完整的类型集合。
  • 消融实验表明,异常值过滤与熵正则化对最优性能均至关重要,尤其在长尾类型分布的数据集中。
  • 该方法在Ultra-Fine和OntoNotes两个基准上均达到最先进性能,证明了其有效性与通用性,且无需外部资源。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。