Skip to main content
QUICK REVIEW

[论文解读] Knowledge Guided Named Entity Recognition for BioMedical Text

Pratyay Banerjee, Kuntal Kumar Pal|arXiv (Cornell University)|Nov 10, 2019
Topic Modeling参考文献 36被引用 4
一句话总结

该论文将生物医学命名实体识别(NER)重新表述为一种知识引导的多答案问答(KGQA)任务,利用实体类型、定义和示例作为上下文以提升实体检测效果。通过在包含18个生物医学语料库的大型统一数据集上进行训练,并采用具备重新上下文化功能的BERT-CNN模型,该方法在18个公开数据集中的12个上达到了最先进(SOTA)的F1分数,优于包括在传统NER上微调的BERT-large在内的强基线模型。

ABSTRACT

In this work, we formulate the NER task as a multi-answer knowledge guided QA task (KGQA) which helps to predict entities only by assigning B, I and O tags without associating entity types with the tags. We provide different knowledge contexts, such as, entity types, questions, definitions and examples along with the text and train on a combined dataset of 18 biomedical corpora. This formulation (a) enables systems to jointly learn NER specific features from varied NER datasets, (b) can use knowledge-text attention to identify words having higher similarity to provided knowledge, improving performance, (c) reduces system confusion by reducing the prediction classes to B, I, O only, and (d) makes detection of nested entities easier. We perform extensive experiments of this KGQA formulation on 18 biomedical NER datasets, and through experiments we note that knowledge helps in achieving better performance. Our problem formulation is able to achieve state-of-the-art results in 12 datasets.

研究动机与目标

  • 为解决生物医学NER中标签错误、类别混淆和数据稀缺等挑战,将任务重新表述为超越传统多分类的范式。
  • 通过仅将预测简化为B、I、O标记,减少系统混淆,避免同时联合预测多种实体类型。
  • 通过整合外部知识(如定义、示例和实体类型)作为上下文提示,提升嵌套实体和稀有实体的检测能力。
  • 通过统一的知识增强训练框架,实现在18个多样化生物医学NER数据集上的联合学习。
  • 评估跨不同生物医学领域和实体类型的迁移学习性能与模型泛化能力。

提出的方法

  • 将NER重新表述为多答案知识引导的问答任务,每个输入为一段文本上下文搭配知识提示(例如:'什么是疾病?','定义疾病:一种影响健康的医学状况。')。
  • 引入一种称为BERT-CNN的重新上下文化层,通过局部卷积特征优化标记表示,以更准确地识别实体边界。
  • 使用来自18个生物医学语料库的统一数据集,包含398,495个训练样本、148,166个验证样本和502,306个测试样本,每个样本均附加了知识上下文。
  • 采用BERT-base作为主干模型,在KGQA形式化的NER任务上进行端到端微调,采用BIO标记方案。
  • 应用知识-文本注意力机制,动态加权知识上下文与输入序列中每个标记的相关性。
  • 通过在源领域上进行训练并在目标领域上进行评估,实现迁移学习,以评估跨领域泛化能力。

实验结果

研究问题

  • RQ1将NER重新表述为知识引导的问答任务,是否能有效减少生物医学实体识别中的标签错误和混淆?
  • RQ2包含多种知识类型(如定义、示例和实体类型问题)是否显著影响NER性能?
  • RQ3单一联合训练模型在具有不同实体类型和领域特征的多个生物医学NER数据集上,其泛化能力达到何种程度?
  • RQ4所提出的具备重新上下文化功能的BERT-CNN模型,在精确匹配F1分数和对稀有或嵌套实体的鲁棒性方面,是否优于标准BERT-based NER模型?
  • RQ5该模型在不同生物医学领域之间的零样本或少样本迁移学习中,效果如何?

主要发现

  • 知识引导的问答形式显著提升了NER性能,在18个公开生物医学NER数据集中的12个上达到了最先进(SOTA)的精确匹配F1分数。
  • 与强基线模型相比,该模型在精确匹配F1上提升了1.5%至11%,包括在医学语料库上微调的BERT-large模型。
  • 迁移学习实验表明,模型在不同领域间泛化良好,F1分数下降幅度为0.5%至20%,且在化学实体上仍保持75%的F1,尽管面临高OOV(未登录词)挑战。
  • 在迁移学习中,'Problem'实体的F1达到94.43,'Test'实体的F1达到94.85,表明不同数据集中相似实体类型之间具有较强的对齐能力。
  • 知识-文本注意力机制的使用提升了可解释性,并增强了对相关知识的关注,从而改善了对模糊或稀有实体的检测。
  • BERT-CNN重新上下文化层有效优化了标记表示,显著提升了实体边界检测的准确性,尤其在嵌套或复杂场景中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。