Skip to main content
QUICK REVIEW

[论文解读] Tree Transformer: Integrating Tree Structures into Self-Attention

Yau-Shian Wang, Hung-yi Lee|arXiv (Cornell University)|Sep 14, 2019
Topic Modeling参考文献 29被引用 11
一句话总结

本文提出 Tree Transformer,一种新颖方法,通过引入‘成分注意力’模块,将层次化树结构整合到 Transformer 的自注意力机制中,该模块通过自注意力从原始文本中诱导出成分树。该方法在语言建模困惑度方面表现更优,且生成的注意力模式更具可解释性、更符合人类直觉,相较于标准 BERT 风格的 Transformer 模型具有优势。

ABSTRACT

Pre-training Transformer from large-scale raw texts and fine-tuning on the desired task have achieved state-of-the-art results on diverse NLP tasks. However, it is unclear what the learned attention captures. The attention computed by attention heads seems not to match human intuitions about hierarchical structures. This paper proposes Tree Transformer, which adds an extra constraint to attention heads of the bidirectional Transformer encoder in order to encourage the attention heads to follow tree structures. The tree structures can be automatically induced from raw texts by our proposed "Constituent Attention" module, which is simply implemented by self-attention between two adjacent words. With the same training procedure identical to BERT, the experiments demonstrate the effectiveness of Tree Transformer in terms of inducing tree structures, better language modeling, and further learning more explainable attention scores.

研究动机与目标

  • 解决标准 Transformer 自注意力机制缺乏层次结构感知的问题,该问题与人类对句法层次结构的直觉不一致。
  • 开发一种方法,能从原始、未标注的文本中自动诱导出成分树结构,而无需依赖有监督的句法解析树。
  • 通过限制注意力头仅在句法成分内部进行注意力计算,提升自注意力机制的可解释性和性能。
  • 评估树结构注意力是否在语言建模性能和注意力模式可解释性方面优于标准 Transformer 模型。

提出的方法

  • 引入‘成分注意力’模块,利用自注意力连接相邻词,并自底向上构建层次化成分结构。
  • 在每个 Transformer 层中对注意力头施加树结构约束,强制其仅在相同句法成分内部进行注意力计算。
  • 采用与 BERT 相同的预训练和微调流程,仅增加成分注意力模块。
  • 采用可微分的端到端训练过程,联合学习树结构与上下文表征。
  • 结合位置编码与诱导的树结构,为模型提供层次化的位置信息。
  • 采用多头注意力机制,其中每个头均被约束仅在由诱导树定义的同一成分内进行注意力计算。

实验结果

研究问题

  • RQ1自注意力机制是否可在不依赖人工标注句法解析树的前提下,被引导以遵循层次化句法结构?
  • RQ2将诱导的树结构整合到注意力机制中,是否能提升语言建模性能,相比标准 Transformer 模型?
  • RQ3Tree Transformer 中的注意力头在多大程度上展现出比标准 BERT 风格模型更可解释、更符合人类直觉的注意力模式?
  • RQ4成分注意力模块是否能以弱监督方式有效从原始文本中诱导出与人工标注一致的连贯成分树?
  • RQ5在控制模型大小和训练流程的前提下,Tree Transformer 与标准 Transformer 的性能表现如何比较?

主要发现

  • 在 WSJ 测试集上,12 层、5800 万参数的 Tree Transformer 实现了 45.6 的测试困惑度,优于具有相似或更高参数量的标准 Transformer 模型。
  • 即使参数量比标准 Transformer 多 10%,Tree Transformer 在相同任务上仍取得更低的困惑度(45.6 vs. 48.1),表明结构归纳偏差带来了性能增益。
  • 模型诱导出的成分树与人工标注的解析结果一致,经无监督句法解析评估验证。
  • Tree Transformer 的注意力矩阵展现出更具结构化、层次化的模式,与人类对句法构成的直觉更吻合,优于标准 Transformer 模型。
  • 即使从预训练 BERT 初始化,模型仍能保持性能,但诱导出的树结构较不连贯,表明 BERT 的注意力头学习了不同的归纳偏置。
  • 添加成分注意力模块使计算成本增加 20%,参数量增加约 10%,但显著提升了可解释性和建模质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。