[论文解读] The Devil is in the Detail: Simple Tricks Improve Systematic Generalization of Transformers
该论文表明,通过简单的架构与训练配置调整——如嵌入缩放、早停、相对位置编码以及通用变换器变体——可在五个基准数据集上显著提升Transformer模型的系统性泛化能力。该方法使COGS数据集上的准确率从35%提升至81%,PCFG的生产力划分准确率从50%提升至85%,在SCAN的长度划分上(截止长度26)使用相对位置编码可实现100%准确率,尽管在独立同分布(IID)划分上并无性能差距。
Recently, many datasets have been proposed to test the systematic generalization ability of neural networks. The companion baseline Transformers, typically trained with default hyper-parameters from standard tasks, are shown to fail dramatically. Here we demonstrate that by revisiting model configurations as basic as scaling of embeddings, early stopping, relative positional embedding, and Universal Transformer variants, we can drastically improve the performance of Transformers on systematic generalization. We report improvements on five popular datasets: SCAN, CFQ, PCFG, COGS, and Mathematics dataset. Our models improve accuracy from 50% to 85% on the PCFG productivity split, and from 35% to 81% on COGS. On SCAN, relative positional embedding largely mitigates the EOS decision problem (Newman et al., 2020), yielding 100% accuracy on the length split with a cutoff at 26. Importantly, performance differences between these models are typically invisible on the IID data split. This calls for proper generalization validation sets for developing neural networks that generalize systematically. We publicly release the code to reproduce our results.
研究动机与目标
- 解决标准Transformer模型在系统性泛化任务中持续失败的问题,尽管其在标准基准测试中表现良好。
- 探究次优基线配置(如默认超参数和绝对位置编码)是否导致系统性泛化评估的不公平。
- 证明仅通过微小的架构与训练调整即可在不引入复杂归纳偏置的情况下显著提升系统性泛化性能。
- 强调需要专门的泛化验证集,因为性能差距在IID划分上是不可见的。
- 为未来神经网络系统性泛化研究建立更强、可复现的基线。
提出的方法
- 通过使用Glorot均匀分布初始化词嵌入并按√d_model进行缩放,实现词嵌入缩放(TEU),以平衡与位置嵌入的关系。
- 通过使用Kaiming正态分布初始化词嵌入(σ = 1/√d_model)并将其位置嵌入幅度降低1/√d_model,实现位置嵌入下缩放(PED)。
- 采用Dai等人(2019)提出的分解注意力机制引入相对位置编码,通过学习向量u和v以及相对位置嵌入P_i-j显式建模相对位置。
- 基于验证损失使用早停策略,防止在IID划分上过拟合,同时保持泛化性能。
- 训练通用变换器变体,通过层间共享参数以提升序列建模与泛化能力。
- 避免同时使用绝对与相对位置编码;除编码器-解码器接口外,所有层均使用相对位置注意力。
实验结果
研究问题
- RQ1标准Transformer超参数与配置在多大程度上限制了其在基准数据集上的系统性泛化性能?
- RQ2仅通过简单架构修改(如嵌入缩放与相对位置编码)是否能显著提升系统性泛化能力,而无需引入符号组件?
- RQ3为何模型间的性能差距在IID验证集上始终无法被检测到?这对泛化评估意味着什么?
- RQ4相对位置编码如何缓解序列到序列任务中的句子结束(EOS)决策问题?
- RQ5一套统一的配置改进是否能在SCAN、COGS、PCFG和数学等多样化系统性泛化基准上实现泛化?
主要发现
- 在PCFG的生产力划分上,通过嵌入缩放与相对位置编码,模型准确率从50%提升至85%。
- 在COGS数据集上,采用相同配置改进后,准确率从35%提升至81%,展现出显著的泛化增益。
- 在SCAN的长度划分上(截止长度26),相对位置编码使准确率达到100%,有效解决了EOS决策问题。
- 在PCFG的系统性划分上,模型准确率达到96%,较基线的72%有显著提升,表明其组合推理能力增强。
- 尽管在泛化划分上性能差异显著,所有模型在IID验证集上的表现完全一致,凸显了专用泛化基准的必要性。
- 代码与训练模型已公开发布,以确保可复现性,并支持未来对系统性泛化方法的基准测试。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。