Skip to main content
QUICK REVIEW

[论文解读] An Empirical Exploration of Skip Connections for Sequential Tagging

Huijia Wu, Jiajun Zhang|arXiv (Cornell University)|Oct 11, 2016
Topic Modeling参考文献 30被引用 9
一句话总结

本文针对深度堆叠双向LSTM中的序列标注任务,提出在单元输出处使用门控身份跳跃连接,实验证明该配置在C&C超词性标注任务上优于连接至门或内部状态的跳跃连接。该方法在CCG超词性标注任务上取得最先进结果(测试准确率94.67%),在POS标注任务上表现优异(准确率97.45%),最优深度为7–9层。

ABSTRACT

In this paper, we empirically explore the effects of various kinds of skip connections in stacked bidirectional LSTMs for sequential tagging. We investigate three kinds of skip connections connecting to LSTM cells: (a) skip connections to the gates, (b) skip connections to the internal states and (c) skip connections to the cell outputs. We present comprehensive experiments showing that skip connections to cell outputs outperform the remaining two. Furthermore, we observe that using gated identity functions as skip mappings works pretty well. Based on this novel skip connections, we successfully train deep stacked bidirectional LSTM models and obtain state-of-the-art results on CCG supertagging and comparable results on POS tagging.

研究动机与目标

  • 探究不同类型的跳跃连接在深度堆叠双向LSTM中对序列标注任务的影响。
  • 确定跳跃连接在堆叠LSTM层中的最优位置——是连接至门、内部状态还是单元输出。
  • 评估各种跳跃映射函数(包括恒等映射、Sigmoid映射和门控身份映射)的有效性。
  • 识别深度序列标注任务中最佳性能的架构配置,尤其关注深度与跳跃连接设计。
  • 证明所提出架构在不同序列标注任务(如CCG超词性标注和POS标注)中的泛化能力。

提出的方法

  • 在神经网络中采用堆叠的双向LSTM,并从较低层的输出向较高层添加跳跃连接。
  • 探索三种跳跃连接类型:连接至输入门、连接至内部单元状态、连接至单元输出。
  • 引入门控身份函数作为跳跃映射,其中跳跃连接通过可学习的Sigmoid门进行调制:$ g_t = \sigma(W_g h_{t-1}^{l} + U_g h_t^{l-2}) $。
  • 为提升性能,特别是在表现最佳的配置中,使用遗忘门偏置为0。
  • 在CCG超词性标注和POS标注任务中均采用相同的模型架构与超参数,未进行再调优。
  • 使用词嵌入和字符嵌入作为输入特征,并在输入深度LSTM网络前进行拼接。

实验结果

研究问题

  • RQ1在堆叠的双向LSTM中,跳跃连接在LSTM模块的哪个位置——门、内部状态或单元输出——带来的收益最大?
  • RQ2不同的跳跃映射函数(恒等映射、Sigmoid映射、门控身份映射)如何影响深度序列标注任务中的模型性能?
  • RQ3在性能与训练稳定性之间权衡下,堆叠双向LSTM中跳跃连接的最优深度是多少?
  • RQ4一个具有共享超参数的单一架构是否能在多个序列标注任务中实现最先进性能?
  • RQ5与标准跳跃连接或无跳跃连接相比,使用门控身份跳跃连接是否能提升训练效率与泛化能力?

主要发现

  • 在CCGbank超词性标注数据集上,将跳跃连接连接至单元输出并使用门控身份映射,取得了94.67%的最高测试准确率。
  • 未使用门控的内部状态跳跃连接(94.33%开发准确率)优于使用门控的版本(94.24%开发准确率),表明无门连接在内部状态路由中可能更有效。
  • 门控身份函数(遗忘门偏置$ b_f = 0 $)表现最佳,在CCGbank数据集上达到94.51%的开发准确率与94.67%的测试准确率。
  • 无门控的恒等映射(94.02%)性能劣于门控版本,表明可学习门控对实现最优性能至关重要。
  • 使用相同架构在POS标注任务上实现了97.45%的测试准确率,表明该模型在无需任务特定调优的情况下具备强大泛化能力,且在CCG超词性标注任务中已达到最先进水平。
  • 堆叠模型的最优深度为7–9层;在11层时性能下降,表明深度与训练稳定性之间存在权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。