[论文解读] RealFormer: Transformer Likes Residual Attention
RealFormer 引入了一种简单且无需参数的技巧,通过在注意力分数中添加残差连接来提升 Transformer 模型的性能,显著改善了 GLUE、SQuAD 和机器翻译等多样化自然语言处理任务的表现。该方法实现了更快的收敛速度,并生成更稀疏、更稳定的注意力模式,达到当前最优结果。
Transformer is the backbone of modern NLP models. In this paper, we propose RealFormer, a simple and generic technique to create Residual Attention Layer Transformer networks that significantly outperform the canonical Transformer and its variants (BERT, ETC, etc.) on a wide spectrum of tasks including Masked Language Modeling, GLUE, SQuAD, Neural Machine Translation, WikiHop, HotpotQA, Natural Questions, and OpenKP. We also observe empirically that RealFormer stabilizes training and leads to models with sparser attention. Source code and pre-trained checkpoints for RealFormer can be found at https://github.com/google-research/google-research/tree/master/realformer.
研究动机与目标
- 在不增加参数或超参数的前提下,提升基于 Transformer 的模型在多样化自然语言处理任务中的性能。
- 探究为注意力分数创建类似 ResNets 中残差连接的直接路径,是否能稳定训练过程并提升泛化能力。
- 评估残差注意力作为即插即用的替代方案在 BERT、ADMIN 和 ETC 等成熟模型中的有效性。
- 分析 RealFormer 中注意力机制的定性行为,特别是层间稀疏性与相关性。
提出的方法
- 通过添加一个跳跃连接,直接将前一层的原始注意力分数传播到当前层,引入残差注意力机制。
- 通过将原始多头注意力分数与来自前一层的注意力分数残差流结合,在应用 Softmax 之前进行融合,从而修改标准 Transformer 编码器模块。
- 使用注意力分数的累计和作为残差组件,保留原始注意力计算的同时,通过残差路径实现梯度流动。
- 将该技术普遍应用于不同类型的 Transformer 变体,包括编码器、解码器以及稀疏注意力机制(如 ETC)。
- 采用与基线模型相同的预训练和微调方案以确保公平比较,且仅需极少的代码修改。
- 在推理阶段使用模型检查点平均技术以提升鲁棒性,尤其适用于大型模型。
实验结果
研究问题
- RQ1在标准和最先进 Transformer 模型中,为注意力分数添加残差连接是否能提升多样化自然语言处理任务的性能?
- RQ2与 Post-LN 和 Pre-LN Transformer 相比,残差注意力是否带来更稳定的训练动态和更快的收敛速度?
- RQ3残差注意力如何影响已训练模型中的注意力稀疏性与层间相关性?
- RQ4RealFormer 是否可作为通用的即插即用改进方案,无需对现有 Transformer 架构或超参数进行任何修改?
- RQ5与标准基线相比,残差注意力是否能在更少的预训练周期内实现更优性能?
主要发现
- 在掩码语言建模和下游 GLUE 任务中,RealFormer 在所有模型尺寸下均优于 Post-LN 和 Pre-LN Transformer,平均性能提升达 2.5 分。
- 在 WMT’14 En-Fr 翻译基准上,RealFormer 仅用 50 个预训练周期即达到新的 SOTA BLEU 得分 43.97,较基线 ADMIN 模型高出 0.25 BLEU 分。
- 在 WikiHop 基准上,RealFormer 将准确率提升至 84.4%,相比之前 SOTA 提升 2.1 个百分点,并在官方排行榜上排名第一。
- RealFormer 在所有四个长上下文基准上均优于 ETC-Large:HotpotQA(联合 F1:73.57 vs. 73.12)、Natural Questions(平均 F1:68.51 vs. 68.07)和 OpenKP(F1@3:44.27 vs. 44.06)。
- 定性分析表明,RealFormer 在头内及相邻层之间均产生更稀疏的注意力模式,暗示其具有正则化效应,可能有助于训练稳定性。
- 尽管仅使用基线模型一半的预训练周期,RealFormer 仍能取得具有竞争力的微调结果,表明其具备更快的收敛速度和更高的样本效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。