Skip to main content
QUICK REVIEW

[论文解读] Transformer Grammars: Augmenting Transformer Language Models with Syntactic Inductive Biases at Scale

Laurent Sartran, Samuel Barrett|arXiv (Cornell University)|Mar 1, 2022
Topic Modeling被引用 4
一句话总结

本文提出了一种新型的Transformer语言模型——Transformer语法(TGs),通过专用的注意力掩码和确定性的树线性化,实现递归句法组合,显著提升了句法敏感的语言建模性能。尽管参数量远小于基线模型,TGs在句法泛化和句法重排序任务上仍优于GPT-2-small、Gopher和Chinchilla等强基线模型,且训练速度更快。

ABSTRACT

We introduce Transformer Grammars (TGs), a novel class of Transformer language models that combine (i) the expressive power, scalability, and strong performance of Transformers and (ii) recursive syntactic compositions, which here are implemented through a special attention mask and deterministic transformation of the linearized tree. We find that TGs outperform various strong baselines on sentence-level language modeling perplexity, as well as on multiple syntax-sensitive language modeling evaluation metrics. Additionally, we find that the recursive syntactic composition bottleneck which represents each sentence as a single vector harms perplexity on document-level language modeling, providing evidence that a different kind of memory mechanism -- one that is independent of composed syntactic representations -- plays an important role in current successful models of long text.

研究动机与目标

  • 探究递归句法组合——这一在小型模型(如RNNGs)中起关键作用的归纳偏置——在现代Transformer语言模型中是否仍具有可扩展性优势。
  • 通过将句法归纳偏置整合到高效的Transformer-XL架构中,解决循环神经网络语法(RNNGs)的可扩展性限制。
  • 评估句法结构是否不仅提升句子级任务的性能,也能提升文档级语言建模的性能。
  • 研究句法泛化与困惑度之间的权衡,特别是与模型词汇复制能力的关系。
  • 探索受句法结构约束的注意力机制是否能在不损失效率的前提下提升结构泛化能力。

提出的方法

  • 在Transformer-XL架构中引入一种类型化、递归的注意力掩码,通过限制线性化句法树中的成分边界来强制执行句法组合。
  • 将每个短语表示为非终结符符号的确定性、分层组合,通过复制结束的非终结符以支持递归注意力模式。
  • 在自回归生成过程中联合建模终结符词和非终结符树成分,使模型能够同时预测字符串和句法结构。
  • 在Penn Treebank和BLLIP-lg数据集上,使用字符串及其对应短语结构树的联合概率分布进行模型训练。
  • 实现一种改进的自回归解码过程,通过结构化注意力保持句法一致性,同时保留标准Transformer的高效性。
  • 使用回归分析分离句法组合对困惑度和句法泛化指标性能的独立贡献。

实验结果

研究问题

  • RQ1通过结构化注意力掩码引入递归句法组合,是否能提升Transformer模型在大规模场景下的语言建模性能?
  • RQ2Transformer语法在句法敏感评估基准上的表现,与无句法的Transformer和句法增强模型相比如何?
  • RQ3递归句法组合的归纳偏置在多大程度上干扰了对低困惑度有贡献的词汇复制能力?
  • RQ4当建模范围从单个句子扩展到完整文档时,句法归纳偏置是否依然有益?
  • RQ5具有显式句法组合能力的模型是否能在句法泛化任务上超越更大规模的预训练语言模型?

主要发现

  • Transformer语法在Hu等人(2020)提出的句法泛化基准上达到最先进性能,尽管参数量仅为GPT-2-small、Gopher和Chinchilla的1/250至1/1000,且训练数据量远少于它们。
  • TGs在句法泛化和句法重排序任务上显著优于无句法的Transformer-XL(terminals)基线模型和更强的TXL(trees)模型。
  • TXL(trees)模型(在无注意力限制下同时预测终结符和非终结符)在句子级困惑度上略优于TGs,表明TGs中的注意力约束可能干扰词汇复制。
  • 在文档级语言建模任务中,TGs的表现明显低于仅预测终结符的TXL(terminals)和TXL(trees)模型,表明单一的句法组合表示不足以应对长上下文建模。
  • 回归分析证实,递归句法组合能提升句法泛化能力,但代价是削弱了词汇复制能力,揭示了句法建模与词汇建模目标之间的部分解耦。
  • TGs的训练速度远快于批处理的RNNGs,证明句法归纳偏置可在Transformer框架中高效扩展,且不损失训练速度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。