[论文解读] DiffusionNER: Boundary Diffusion for Named Entity Recognition
DiffusionNER 提出了一种新颖的生成式命名实体识别方法,通过将 NER 建模为在噪声跨度上的边界去噪扩散过程。它训练一个反向扩散模型,逐步将噪声跨度精炼为准确的实体边界,在平面和嵌套 NER 基准上实现了最先进或具有竞争力的性能,且推理速度更快、更具动态性与并行性,优于自回归方法。
In this paper, we propose DiffusionNER, which formulates the named entity recognition task as a boundary-denoising diffusion process and thus generates named entities from noisy spans. During training, DiffusionNER gradually adds noises to the golden entity boundaries by a fixed forward diffusion process and learns a reverse diffusion process to recover the entity boundaries. In inference, DiffusionNER first randomly samples some noisy spans from a standard Gaussian distribution and then generates the named entities by denoising them with the learned reverse diffusion process. The proposed boundary-denoising diffusion process allows progressive refinement and dynamic sampling of entities, empowering DiffusionNER with efficient and flexible entity generation capability. Experiments on multiple flat and nested NER datasets demonstrate that DiffusionNER achieves comparable or even better performance than previous state-of-the-art models.
研究动机与目标
- 通过引入一种非自回归、基于扩散模型的替代方法,解决基于自回归生成的 NER 模型效率低下和暴露偏差的问题。
- 探索扩散模型——此前主要用于图像和音频生成——在离散文本序列上的应用,以解决如 NER 等抽取式 NLP 任务。
- 通过将噪声跨度数量与训练约束解耦,实现动态且灵活的实体生成,支持可变长度推理。
- 通过迭代去噪提升实体边界精炼效果,增强平面和嵌套实体识别的精确度。
提出的方法
- 将 NER 建模为边界去噪扩散过程,其中实体边界在固定前向过程中逐步被高斯噪声污染。
- 利用去噪网络学习反向扩散过程,在训练期间逐步精炼噪声跨度以恢复标准答案的实体边界。
- 在推理阶段,从标准高斯先验中采样噪声跨度,并通过学习到的反向过程生成实体,实现在不同跨度上的并行生成。
- 在时间步上使用共享的 Transformer 编码器以提升推理效率,并支持在测试时对不同数量的噪声跨度进行动态采样。
- 使用具有跨度间自注意力和到输入句子的交叉注意力的跨度编码器,以建模交互关系并提升边界预测性能。
- 应用方差调度器(余弦或线性)以控制时间步上的噪声强度,超参数在每个数据集上进行调优以获得最佳性能。
实验结果
研究问题
- RQ1扩散模型能否有效适配到离散文本序列上的抽取式 NLP 任务(如命名实体识别)?
- RQ2与自回归生成相比,边界去噪扩散过程是否能提升实体边界精炼和泛化能力?
- RQ3DiffusionNER 是否能在实现更快、非自回归推理的同时,支持动态采样实体跨度并达到具有竞争力的性能?
- RQ4模型性能对架构选择(如预训练语言模型、注意力机制和方差调度器)的敏感性如何?
主要发现
- DiffusionNER 在六个平面和嵌套 NER 数据集上实现了最先进或具有竞争力的性能,包括在 ACE04 上达到 88.99 的 F1 值,在 CoNLL03 上达到 92.89 的 F1 值(使用 RoBERTa-Large)。
- 模型对训练期间使用的噪声跨度数量表现出强鲁棒性,K=60、120 和 150 时性能稳定,表明对扩展策略不敏感。
- 随机扩展策略优于重复扩展策略,在 K=120 时,ACE04 上达到 88.53 的 F1 值,CoNLL03 上达到 92.79 的 F1 值。
- 在 ACE04 上,余弦方差调度器表现最佳(T=1000 时 F1 为 88.39);在 CoNLL03 上,线性调度器表现最佳(T=1500 时 F1 为 92.87)。
- 消融实验表明,跨度间的自注意力和到输入句子的交叉注意力均至关重要,移除后性能分别下降 1.37% 和 1.15%。
- 由于支持并行生成和动态采样,该模型在推理速度和灵活性上优于自回归方法,且通过时间步间共享编码器进一步提升了效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。