[论文解读] Few-Shot Nested Named Entity Recognition
本文提出了一种基于双线性注意力的对比学习(BCL)框架,用于少样本嵌套命名实体识别,通过利用跨度依赖表示和对比学习,在标注数据有限的情况下区分嵌套实体。该方法在英语、德语和俄语数据集上均取得了最先进性能,在5-shot设置下F1分数相比基线最高提升5.57%。
While Named Entity Recognition (NER) is a widely studied task, making inferences of entities with only a few labeled data has been challenging, especially for entities with nested structures. Unlike flat entities, entities and their nested entities are more likely to have similar semantic feature representations, drastically increasing difficulties in classifying different entity categories in the few-shot setting. Although prior work has briefly discussed nested structures in the context of few-shot learning, to our best knowledge, this paper is the first one specifically dedicated to studying the few-shot nested NER task. Leveraging contextual dependency to distinguish nested entities, we propose a Biaffine-based Contrastive Learning (BCL) framework. We first design a Biaffine span representation module for learning the contextual span dependency representation for each entity span rather than only learning its semantic representation. We then merge these two representations by the residual connection to distinguish nested entities. Finally, we build a contrastive learning framework to adjust the representation distribution for larger margin boundaries and more generalized domain transfer learning ability. We conducted experimental studies on three English, German, and Russian nested NER datasets. The results show that the BCL outperformed three baseline models on the 1-shot and 5-shot tasks in terms of F1 score.
研究动机与目标
- 解决在仅有少量标注样本时识别嵌套命名实体的挑战。
- 克服在低资源设置下因共享语义表示而导致嵌套实体难以区分的问题。
- 通过学习更具判别性的跨度表示,提升少样本学习中的泛化能力与领域迁移性能。
- 缓解在标签空间不一致的跨领域迁移学习中出现的标签差异问题。
- 在多语言嵌套NER数据集上验证所提框架的有效性。
提出的方法
- 设计了一个双线性跨度表示模块,用于学习实体跨度内部及跨跨度的词语间上下文依赖模式。
- 通过残差连接将词级语义表示与跨度级依赖表示融合,以增强表示的判别能力。
- 采用带有圆圈损失(circle loss)的对比学习目标,促使正样本对在表示空间中相互远离,并增大边界间隔。
- 框架使用多语言预训练语言模型(BERT-base-multilingual)实现跨语言迁移与领域适应。
- 模型在仅每类1–5个标注样本的支持集上进行端到端训练,推理在查询集上完成。
- 在对比损失中引入偏置项,以强调最不相似的正样本对,从而提升表示学习效果。

实验结果
研究问题
- RQ1当仅有1个或少数几个标注样本时,少样本学习框架能否有效识别嵌套命名实体?
- RQ2在低资源设置下,跨度级依赖表示在区分嵌套实体与扁平实体方面有何改善作用?
- RQ3基于边界间隔的对比学习在少样本嵌套NER中在多大程度上提升了泛化能力与领域迁移性能?
- RQ4双线性结构与残差连接的融合对嵌套实体识别性能有何影响?
- RQ5所提框架是否具有跨语言泛化能力,特别是在印欧语系之间?
主要发现
- BCL框架在所有三个数据集(英语、德语、俄语)的1-shot与5-shot设置下均优于三种基线模型,在GENIA数据集的5-shot设置下,F1分数相比基线绝对提升5.57%。
- 消融实验表明,双线性层对性能贡献最大,在1-shot与5-shot设置下分别提升F1 1.73%与5.57%。
- 移除语义表示与依赖表示之间的残差连接后,F1分别下降1.76%与1.29%,表明其在表示融合中的关键作用。
- 在对比损失中引入偏置项后,F1分别提升1.38%与2.05%,表明模型对困难正样本对的关注度得到增强。
- 使用多语言BERT模型的性能略低于英文cased BERT在英语数据集上的表现,但差异微小,支持多语言模型在跨语言迁移中的有效性。
- 在扁平NER基准测试中,BCL表现具有竞争力,尤其在5-shot设置下;但在1–2-shot设置下性能差距显现,原因在于正样本过少,难以学习分布特征。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。