Skip to main content
QUICK REVIEW

[论文解读] Transformers Generalize Linearly

Jackson Petty, Robert Frank|arXiv (Cornell University)|Sep 24, 2021
Topic Modeling参考文献 24被引用 10
一句话总结

本文研究了在训练数据在线性与分层模式之间存在歧义时,Transformers 是否在句法序列到序列任务中表现出对分层泛化的归纳偏置。尽管在分布内数据上表现强劲,Transformers 在需要分层结构的分布外泛化任务中始终表现不佳,显示出对线性泛化的明显偏好——甚至在这一偏向上优于循环网络。

ABSTRACT

Natural language exhibits patterns of hierarchically governed dependencies, in which relations between words are sensitive to syntactic structure rather than linear ordering. While re-current network models often fail to generalize in a hierarchically sensitive way (McCoy et al.,2020) when trained on ambiguous data, the improvement in performance of newer Trans-former language models (Vaswani et al., 2017)on a range of syntactic benchmarks trained on large data sets (Goldberg, 2019; Warstadtet al., 2019) opens the question of whether these models might exhibit hierarchical generalization in the face of impoverished data.In this paper we examine patterns of structural generalization for Transformer sequence-to-sequence models and find that not only do Transformers fail to generalize hierarchically across a wide variety of grammatical mapping tasks, but they exhibit an even stronger preference for linear generalization than comparable recurrent networks

研究动机与目标

  • 确定 Transformers 是否在句法序列到序列任务中表现出对分层泛化的归纳偏置。
  • 在相同且存在歧义的训练数据下,比较 Transformers 与循环网络(LSTMs、GRUs)的泛化行为。
  • 评估句法基准任务上的成功是否源于架构的归纳偏置,还是源于大规模训练数据的暴露。
  • 在能明确区分线性和分层泛化模式的分布外测试集上评估泛化性能。
  • 探究观察到的 Transformers 在句法任务上的成功,究竟是源于架构的归纳偏置,还是数据驱动的模式学习。

提出的方法

  • 设计四个英语转导任务,其训练数据具有歧义性,允许同时实现线性和分层泛化。
  • 构建分布内测试集和分布外泛化(gen)测试集,以区分线性和分层泛化模式。
  • 在相同数据上训练 Transformer 模型(4头,3层,128维)和循环模型(LSTMs、GRUs),并对比其带注意力与不带注意力(加性/乘性)的设置。
  • 为循环模型使用单层架构,隐藏层和嵌入层维度均为 256 维,并为每类模型进行 10 次随机权重初始化。
  • 通过 10 次运行的中位数准确率评估模型,指标聚焦于完整序列准确率以及关键元素(如否定标记、反身代词先行词)的位置。
  • 将模型预测分类为反身-线性、主语-线性与分层三类,以评估指代消解任务中的泛化策略。

实验结果

研究问题

  • RQ1当训练数据在线性和分层模式之间存在歧义时,Transformer 架构是否表现出对分层泛化的偏置?
  • RQ2在分布外句法泛化任务中,Transformers 的泛化表现与循环网络(LSTMs、GRUs)相比如何?
  • RQ3Transformers 在句法基准任务上的成功,在多大程度上源于架构的归纳偏置,而非大规模训练数据的暴露?
  • RQ4当线性模式与训练数据一致时,是否仍能正确泛化到分层结构?
  • RQ5在不同神经网络架构中,线性与分层泛化偏好的相对强度如何?

主要发现

  • Transformers 在所有任务的分布内测试集中均达到接近上限的性能,表明其能从训练数据中有效学习模式。
  • 在分布外泛化测试集中,Transformers 统一表现失败,对于需要分层泛化的任务(如 neg-main、反身代词指代),准确率接近零。
  • 所有模型,包括 Transformers,均在 gen 测试集中强烈偏好线性泛化策略(如 neg-first、reflexive-linear),即使分层模式才是唯一一致的泛化方式。
  • LSTMs 在反身代词指代任务上的中位分层性能最高(65.8%),优于 Transformers 和 GRUs。
  • 线性泛化偏好在所有任务和模型类型中保持一致,且 Transformers 对线性模式的偏好最为强烈。
  • 结果表明,Transformers 在句法基准任务上的成功并非源于对分层结构的内在归纳偏置,而是源于从大规模语料中学习数据驱动的模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。