Skip to main content
QUICK REVIEW

[论文解读] Constituency Parsing with a Self-Attentive Encoder

Nikita Kitaev, Dan Klein|arXiv (Cornell University)|May 2, 2018
Natural Language Processing Techniques参考文献 9被引用 44
一句话总结

本文在一个判别式成分分析器中用自注意力编码器替代了 LSTM 编码器,在 WSJ 上达到最先进的结果并在多语言方面表现出色,并分析将内容注意力与位置注意力分离如何改进分析。

ABSTRACT

We demonstrate that replacing an LSTM encoder with a self-attentive architecture can lead to improvements to a state-of-the-art discriminative constituency parser. The use of attention makes explicit the manner in which information is propagated between different locations in the sentence, which we use to both analyze our model and propose potential improvements. For example, we find that separating positional and content information in the encoder can lead to improved parsing accuracy. Additionally, we evaluate different approaches for lexical representation. Our parser achieves new state-of-the-art results for single models trained on the Penn Treebank: 93.55 F1 without the use of any external data, and 95.13 F1 when using pre-trained word representations. Our parser also outperforms the previous best-published accuracy figures on 8 of the 9 languages in the SPMRL dataset.

研究动机与目标

  • 证明自注意力编码器在一个最先进的判别式成分分析器中可以超越 LSTM 编码器。
  • 研究注意力类型(内容 vs. 位置)如何影响解析性能并探索信息的显式分解。
  • 评估不同的词汇表示,包括子词特征和预训练上下文嵌入,以提升解析准确性。
  • 在不使用外部数据且使用预训练表示的情况下展示在 WSJ 的最先进结果;评估在 SPMRL 上的多语言泛化。
  • 分析长距离依赖和全局上下文在解析决策中的作用。

提出的方法

  • 使用一个以 Transformer 为灵感的自注意力网络作为编码器,包含 8 层多头自注意力和位置前馈子层。
  • 通过一个神经网络在成对端点表示上计算跨度分数 s(i,j,l),遵循 Stern et al. (2017a) 的做法。
  • 输入表示结合词嵌入、POS 标签嵌入和学习的位置信息嵌入;扩展为分解的(分离的)内容和位置信息。
  • 用带有边界的 margin-based hinge 损失对带标注的跨度进行训练,使用 CKY 风格的推理进行解码。
  • 尝试分解注意力以分离内容和位置信号,并尝试替代的词汇表示(CharLSTM、CharConcat、ELMo)。
  • 在 Penn Treebank WSJ 和 SPMRL 多语言数据集上进行评测;报告开发集和测试集的 F1 得分。

实验结果

研究问题

  • RQ1自注意力编码器是否能在判别式成分分析中超越基于 LSTM 的编码器?
  • RQ2在编码器中显式分离内容信息和位置信息是否能提高解析准确性?
  • RQ3不同的词汇表示(包括子词特征和上下文嵌入)对解析性能有何影响?
  • RQ4模型在 WSJ 上的表现以及在 SPMRL 的跨语言表现如何?

主要发现

  • 自注意力编码器在 WSJ 开发数据上优于 LSTM 编码器(92.67 F1 对 92.24 F1)。
  • 分解内容和位置信息可带来性能提升(开发集分解后为 93.15 F1)。
  • 禁用内容注意力影响有限,位置注意力总体更为关键;在后几层内容有帮助。
  • 长距离注意力对于最大化准确性至关重要;严格的窗口限制会降低性能,而放宽的窗口限制保留了一些全局汇聚的好处。
  • CharLSTM 词汇表示在词汇层面超越 POS 标签,甚至在没有词嵌入的情况下也能获得较好结果(CharLSTM 93.61 开发集配合嵌入;93.40 无嵌入)。
  • ELMo 上下文嵌入将 WSJ 测试集 F1 提升至 95.13(单系统 WSJ 的最先进水平),前提是 4 层编码器;基线 93.55 F1(单系统,仅 WSJ)在没有外部数据的情况下实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。