Skip to main content
QUICK REVIEW

[论文解读] GCDT: A Global Context Enhanced Deep Transition Architecture for Sequence Labeling

Yijin Liu, Fandong Meng|arXiv (Cornell University)|Jun 6, 2019
Natural Language Processing Techniques参考文献 38被引用 10
一句话总结

本文提出GCDT,一种用于序列标注的全局上下文增强深度转移架构,通过加深状态转移并注入句子级别的全局上下文,提升了双向LSTM的性能。通过利用BERT作为外部资源,该方法在CoNLL03 NER任务上达到93.47的F1分数,在CoNLL2000 Chunking任务上达到97.30的F1分数,优于相同设置下的先前方法。

ABSTRACT

Current state-of-the-art systems for sequence labeling are typically based on the family of Recurrent Neural Networks (RNNs). However, the shallow connections between consecutive hidden states of RNNs and insufficient modeling of global information restrict the potential performance of those models. In this paper, we try to address these issues, and thus propose a Global Context enhanced Deep Transition architecture for sequence labeling named GCDT. We deepen the state transition path at each position in a sentence, and further assign every token with a global representation learned from the entire sentence. Experiments on two standard sequence labeling tasks show that, given only training data and the ubiquitous word embeddings (Glove), our GCDT achieves 91.96 F1 on the CoNLL03 NER task and 95.43 F1 on the CoNLL2000 Chunking task, which outperforms the best reported results under the same settings. Furthermore, by leveraging BERT as an additional resource, we establish new state-of-the-art results with 93.47 F1 on NER and 97.30 F1 on Chunking.

研究动机与目标

  • 解决基于BiLSTM的序列标注模型中浅层状态转移和全局上下文建模不足的局限性。
  • 通过加深每个标记位置隐藏状态之间的转移路径,提升表征学习能力。
  • 通过从整个句子中提取的全局上下文嵌入,增强局部标记表征。
  • 在不依赖任务特定或大规模外部语料的情况下,实现在标准序列标注基准上的SOTA性能。
  • 通过消融研究探究全局上下文和深度转移组件的有效性。

提出的方法

  • 该模型采用深度转移(DT)RNN架构,增加连续隐藏状态之间状态转移的深度,从而实现更丰富的表征学习。
  • 全局上下文编码器通过对其整个输入序列的隐藏状态求和,计算句子级别的表征,随后与标记级别的表征拼接。
  • 全局上下文嵌入用于丰富局部标记表征,实现组合式交互,从而提升预测性能。
  • 序列标注编码器和解码器使用DT-RNN与CRF解码,以建模标签依赖关系并预测序列。
  • 模型通过交叉熵损失进行端到端训练,推理过程中使用Viterbi解码。
  • 额外实验将BERT嵌入作为外部特征集成,以进一步提升性能。

实验结果

研究问题

  • RQ1在RNN中加深状态转移路径是否能提升序列标注性能?
  • RQ2在序列标注任务中,注入句子级别的全局上下文表征是否能增强局部标记表征?
  • RQ3与标准BiLSTM或GRU架构相比,全局上下文编码器对模型性能的影响如何?
  • RQ4将GCDT与BERT结合,在NER和分块任务上能将SOTA结果提升到何种程度?
  • RQ5每个组件(全局上下文、深度转移、CRF)对整体性能提升的贡献分别是什么?

主要发现

  • 仅使用GloVe嵌入和训练数据时,GCDT在CoNLL03 NER任务上达到91.96的F1分数,优于相同设置下的先前SOTA结果。
  • 在CoNLL2000分块任务上,GCDT在相同设置下达到95.43的F1分数,再次超越先前方法。
  • 当集成BERT嵌入后,GCDT在CoNLL03 NER任务上达到93.47的F1分数,在CoNLL2000分块任务上达到97.30的F1分数,创下新的SOTA记录。
  • 消融研究证实,深度转移机制和全局上下文编码器均对性能提升有显著贡献。
  • 即使在序列标注模块中将GRUs替换为DTs时,全局上下文编码器仍能提升性能,表明其具有鲁棒性和有效性。
  • 模型复杂度分析表明,DT在参数效率和性能方面均优于GRUs,尤其在全局模块和序列模块中同时使用时表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。