[论文解读] GRN: Gated Relation Network to Enhance Convolutional Neural Network for Named Entity Recognition
该论文提出Gated Relation Network(GRN),一种基于CNN的架构,通过门控融合机制建模词与词之间的关系,实现并行计算并提升长距离上下文捕捉能力。GRN在CoNLL-2003(无外部知识时F1为91.44,使用ELMo时为92.34)和Ontonotes 5.0(F1为87.67)上达到SOTA性能,同时相比BiLSTM-CRF基线模型,训练和推理时间更短。
The dominant approaches for named entity recognition (NER) mostly adopt complex recurrent neural networks (RNN), e.g., long-short-term-memory (LSTM). However, RNNs are limited by their recurrent nature in terms of computational efficiency. In contrast, convolutional neural networks (CNN) can fully exploit the GPU parallelism with their feedforward architectures. However, little attention has been paid to performing NER with CNNs, mainly owing to their difficulties in capturing the long-term context information in a sequence. In this paper, we propose a simple but effective CNN-based network for NER, i.e., gated relation network (GRN), which is more capable than common CNNs in capturing long-term context. Specifically, in GRN we firstly employ CNNs to explore the local context features of each word. Then we model the relations between words and use them as gates to fuse local context features into global ones for predicting labels. Without using recurrent layers that process a sentence in a sequential manner, our GRN allows computations to be performed in parallel across the entire sentence. Experiments on two benchmark NER datasets (i.e., CoNLL2003 and Ontonotes 5.0) show that, our proposed GRN can achieve state-of-the-art performance with or without external knowledge. It also enjoys lower time costs to train and test.We have made the code publicly available at https://github.com/HuiChen24/NER-GRN.
研究动机与目标
- 为解决循环神经网络(RNNs)在命名实体识别(NER)中因顺序计算导致的效率低下问题,其限制了GPU的并行处理能力。
- 提升卷积神经网络(CNNs)捕捉序列中长距离依赖关系的能力,这是制约其在NER中表现的关键限制因素。
- 开发一种基于CNN的NER模型,其性能可与当前最先进的BiLSTM-CRF模型相当或更优,同时通过完全并行化实现更快的训练和推理速度。
- 提出一种新型门控关系层,用于建模所有词对之间的关系,并利用可学习门控机制将局部特征融合为全局表示。
提出的方法
- 该模型采用四层架构:表示层(词嵌入和字符嵌入)、上下文层(使用多种卷积核大小的CNN以提取局部特征)、关系层(对句子中所有词对进行门控关系建模)以及用于序列标注的CRF层。
- 在关系层中,每个词的全局表示通过使用可学习门控机制建模其与句子中其他所有词的关系来计算。
- 门控机制动态控制每个词的局部上下文对全局表示的贡献程度,从而实现对长距离依赖关系的有效建模。
- 模型采用端到端训练,使用CRF作为损失函数以保持序列中标签的一致性。
- 该方法完全避免使用循环层,使得句子中所有计算均可并行执行。
- 关系层使用L2归一化的注意力权重,用于可视化和解释长距离词依赖关系。
实验结果
研究问题
- RQ1基于CNN的模型是否能在不依赖循环结构的情况下实现NER的SOTA性能?
- RQ2门控关系机制是否能有效建模超出标准CNN感受野范围的序列长距离依赖关系?
- RQ3所提出的GRN模型是否在保持或提升准确率的同时,相比BiLSTM-CRF基线模型实现了更快的训练和推理速度?
- RQ4与直接拼接或门控注意力等替代融合机制相比,所提出的门控关系层在性能和效率方面表现如何?
主要发现
- GRN在CoNLL-2003上取得91.44的F1分数(无外部知识),优于以往的CNN基线模型,并与许多BiLSTM-CRF模型相当或更优。
- 使用ELMo嵌入后,GRN在CoNLL-2003上的F1分数达到92.34,表明其与预训练上下文嵌入具有强大兼容性。
- 在Ontonotes 5.0上,GRN取得87.67的F1分数,确立了CNN基线模型在此基准上的SOTA性能。
- GRN在CoNLL-2003上相比CNN-BiLSTM-CRF基线模型,训练速度提升1.16倍,测试速度提升1.19倍,表明计算效率更高。
- 在较短句子上(如CoNLL-2003,平均长度约14)速度提升更明显,而在较长句子上(如Ontonotes 5.0,平均长度约18)则相对减弱,这是由于关系层计算成本降低所致。
- 关系层的可视化结果显示,非相邻实体词之间(如'Sun'和'Sidek')存在显著的门控权重,证实了模型能够捕捉超出CNN感受野的长距离依赖关系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。