Skip to main content
QUICK REVIEW

[论文解读] Self-attention-based BiGRU and capsule network for named entity recognition

Jianfeng Deng, Lianglun Cheng|arXiv (Cornell University)|Jan 30, 2020
Topic Modeling参考文献 33被引用 13
一句话总结

该论文提出了一种B-SABCN模型,结合BERT、双向GRU(BiGRU)、自注意力机制和胶囊网络(CapsNet),用于中文命名实体识别(NER)。通过利用上下文化的BERT嵌入、BiGRU进行序列建模、自注意力机制突出关键特征,以及CapsNet实现层次化实体分类,该模型在两个中文NER数据集上实现了最先进(SOTA)的性能表现,且无需外部知识,其在MSRA数据集上的F1得分为94.97%,在Diabetes数据集上的F1得分为78.16%。

ABSTRACT

Named entity recognition(NER) is one of the tasks of natural language processing(NLP). In view of the problem that the traditional character representation ability is weak and the neural network method is unable to capture the important sequence information. An self-attention-based bidirectional gated recurrent unit(BiGRU) and capsule network(CapsNet) for NER is proposed. This model generates character vectors through bidirectional encoder representation of transformers(BERT) pre-trained model. BiGRU is used to capture sequence context features, and self-attention mechanism is proposed to give different focus on the information captured by hidden layer of BiGRU. Finally, we propose to use CapsNet for entity recognition. We evaluated the recognition performance of the model on two datasets. Experimental results show that the model has better performance without relying on external dictionary information.

研究动机与目标

  • 为解决传统字符级表示方法和基于RNN的模型在捕捉中文NER中长距离依赖关系和重要上下文特征方面的局限性。
  • 通过引入自注意力机制,动态加权BiGRU提取的相关隐藏特征,以提升实体识别的准确性。
  • 通过用向量化的胶囊网络替代标量输出,保留实体特征之间的空间关系,从而增强分类的鲁棒性。
  • 在不依赖外部词典或语言资源的前提下,评估模型在通用领域和特定领域中文NER数据集上的性能表现。

提出的方法

  • 利用预训练的BERT语言模型生成上下文化的字符级嵌入,相较于静态的word2vec,提升了语义表征能力。
  • 采用双向门控循环单元(BiGRU)捕捉输入序列中的双向长距离依赖关系。
  • 在BiGRU隐藏状态上引入自注意力机制,为特征分配动态权重,突出信息丰富的词元,降低非实体词带来的噪声影响。
  • 应用胶囊网络(CapsNet)建模实体特征之间的层次关系,其中胶囊输出表示实体类型的可能性及其实例化参数。
  • 将CapsNet的输出与CRF结合用于序列标注,确保实体边界预测的一致性。
  • 使用交叉熵损失进行端到端训练,并采用标准优化技术在下游NER任务上进行微调。

实验结果

研究问题

  • RQ1在BERT嵌入基础上,结合自注意力增强的BiGRU是否能提升中文NER中上下文特征的表征能力?
  • RQ2胶囊网络的集成相较于传统的标量分类方法,在建模实体关系和提升识别准确率方面表现如何?
  • RQ3自注意力机制在多大程度上减轻了冗余非实体词在序列标注中的负面影响?
  • RQ4所提出的B-SABCN模型是否在无需外部知识的前提下,优于现有最先进方法,在通用和特定领域中文NER基准上表现更优?
  • RQ5BERT、自注意力和CapsNet各组件对整体性能提升的独立贡献分别是什么?

主要发现

  • B-SABCN模型在MSRA中文NER数据集上取得了94.97%的F1得分,相比BiLSTM-CRF基线模型提升了6个百分点。
  • 在特定领域的Diabetes数据集上,模型F1得分为78.16%,相比BiLSTM-CRF模型高出6.12个百分点,相比CNN-BiLSTM-CRF模型高出1.84个百分点。
  • 消融实验表明,BERT嵌入贡献最大,相较于基于word2vec的输入,F1得分提升4个百分点,主要得益于对多义性和上下文的更好处理。
  • 自注意力机制在MSRA数据集上带来0.3%的F1提升,在Diabetes数据集上带来0.4%的提升,证明其在过滤无关特征和增强关键词注意力方面的有效性。
  • 将标量输出替换为胶囊基表示,在MSRA数据集上带来0.16%的F1提升,在Diabetes数据集上带来0.11%的提升,表明向量化分类能保留更多判别性信息。
  • 完整版B-SABCN模型(结合BERT、自注意力与CapsNet)在两个数据集上均取得最佳性能,验证了所有组件协同作用在提升NER准确率方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。