Skip to main content
QUICK REVIEW

[论文解读] Improving Distantly-Supervised Named Entity Recognition with Self-Collaborative Denoising Learning

Xinghua Zhang, Bowen Yu|arXiv (Cornell University)|Oct 9, 2021
Text and Document Classification Technologies被引用 5
一句话总结

本文提出了一种名为自协同去噪学习(Self-Collaborative Denoising Learning, SCDL)的新框架,用于远程监督命名实体识别(DS-NER),通过联合训练两个教师-学生网络,迭代地优化噪声标签。通过结合每个网络内部的自去噪与网络之间的协同去噪,SCDL 在无需任何假设的前提下,有效处理了不完整和不准确的标注,且在五个真实世界数据集上实现了最先进性能。

ABSTRACT

Distantly supervised named entity recognition (DS-NER) efficiently reduces labor costs but meanwhile intrinsically suffers from the label noise due to the strong assumption of distant supervision. Typically, the wrongly labeled instances comprise numbers of incomplete and inaccurate annotation noise, while most prior denoising works are only concerned with one kind of noise and fail to fully explore useful information in the whole training set. To address this issue, we propose a robust learning paradigm named Self-Collaborative Denoising Learning (SCDL), which jointly trains two teacher-student networks in a mutually-beneficial manner to iteratively perform noisy label refinery. Each network is designed to exploit reliable labels via self denoising, and two networks communicate with each other to explore unreliable annotations by collaborative denoising. Extensive experimental results on five real-world datasets demonstrate that SCDL is superior to state-of-the-art DS-NER denoising methods.

研究动机与目标

  • 为解决远程监督命名实体识别(DS-NER)中不完整和不准确的标签噪声双重挑战,此类噪声会损害模型性能。
  • 开发一种去噪框架,充分利用误标数据,且不依赖于对标签质量的强假设。
  • 通过自去噪与协同学习,实现两个网络之间的相互改进,以实现鲁棒的标签优化。
  • 在真实噪声条件下,超越现有最先进去噪方法在 DS-NER 中的性能表现。

提出的方法

  • SCDL 在协同训练范式下联合训练两个教师-学生网络,每个网络通过教师模型的高置信度、一致预测实现自去噪,以训练学生模型。
  • 每个网络使用指数移动平均(EMA)基于学生模型的微调参数逐步更新教师模型,从而稳定学习过程。
  • 外层循环通过使用一个网络教师模型生成的高质量伪标签,对另一个网络训练数据中的噪声标签进行协同去噪。
  • 内层与外层循环交替迭代,使自去噪生成更优的伪标签,协同去噪则在反馈回路中持续提升标签质量。
  • 该框架利用两个网络对噪声的不同敏感性,增强鲁棒性,并避免自训练方法中常见的确认偏见。
  • 仅两个学生模型进行反向传播,而两个教师模型通过仅前向计算的 EMA 方式更新,从而降低计算开销。

实验结果

研究问题

  • RQ1自协同学习框架是否能在无需先验假设的前提下,有效处理 DS-NER 中的不完整与不准确标签噪声?
  • RQ2与自训练或单网络去噪相比,两个教师-学生网络的协同训练在标签优化方面有何改进?
  • RQ3SCDL 在多大程度上能有效利用误标数据,以提升模型泛化能力与测试性能?
  • RQ4在不同噪声比例下,SCDL 与最先进去噪基线方法相比表现如何?

主要发现

  • 在 CoNLL03 数据集上,SCDL 的测试 F1 分数达到 81.22,经去噪后相比初始噪声标签的 F1 分数 70.97 显著提升。
  • 在 Twitter 数据集上,SCDL 将 F1 分数从 37.73 提升至 50.82,优于 BOND(42.27)。
  • SCDL 在高噪声比例(最高达 80%)下仍保持强劲性能,表现出色,而其他模型则明显退化。
  • 该框架展现出优越的泛化能力,SCDL 在所有五个评估的真实世界 DS-NER 数据集上均优于 BOND 及其他基线模型。
  • 效率分析表明,SCDL 的训练速度具有竞争力(Tesla T4 上达 1.5 批次/秒),且推理效率与单模型推理相当。
  • 案例研究证实,SCDL 成功修正了不完整的标注(如 'Abyss DeJesus')与不准确的标签(如 'St. Christopher Children’s Hospital'),验证了其双重去噪能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。