Skip to main content
QUICK REVIEW

[论文解读] Foundation Transformers

Hongyu Wang, Shuming Ma|arXiv (Cornell University)|Oct 12, 2022
Natural Language Processing Techniques被引用 13
一句话总结

本文提出 Magneto,一种基础型 Transformer 变体,通过统一语言、视觉、语音和多模态任务的架构与训练稳定性,实现了卓越性能。通过提出子层层归一化(Sub-LayerNorm)和理论驱动的初始化策略,与 BERT、GPT、ViT 和 BEiT-3 等事实上的 Transformer 变体相比,Magneto 在性能和训练稳定性方面均表现更优。

ABSTRACT

A big convergence of model architectures across language, vision, speech, and multimodal is emerging. However, under the same name "Transformers", the above areas use different implementations for better performance, e.g., Post-LayerNorm for BERT, and Pre-LayerNorm for GPT and vision Transformers. We call for the development of Foundation Transformer for true general-purpose modeling, which serves as a go-to architecture for various tasks and modalities with guaranteed training stability. In this work, we introduce a Transformer variant, named Magneto, to fulfill the goal. Specifically, we propose Sub-LayerNorm for good expressivity, and the initialization strategy theoretically derived from DeepNet for stable scaling up. Extensive experiments demonstrate its superior performance and better stability than the de facto Transformer variants designed for various applications, including language modeling (i.e., BERT, and GPT), machine translation, vision pretraining (i.e., BEiT), speech recognition, and multimodal pretraining (i.e., BEiT-3).

研究动机与目标

  • 解决在不同模态和任务中缺乏统一的、通用的 Transformer 架构的问题。
  • 克服大规模 Transformer 模型在扩展过程中出现的训练不稳定性问题。
  • 开发一种单一主干架构,在无需针对任务调优的情况下,于语言、视觉、语音和多模态应用中均表现优异。
  • 通过理论推导的初始化方法与架构创新,确保训练稳定性。
  • 在多种下游任务中支持更高的学习率和更鲁棒的优化。

提出的方法

  • 提出子层层归一化(Sub-LayerNorm,Sub-LN),即在每个子层(自注意力与前馈网络)的输入和输出投影前均增加一层层归一化。
  • 提出一种源自 DeepNet(Wang et al., 2022a)的新初始化方案,其增益值根据模型深度和架构类型进行调制。
  • 将该初始化方案应用于 Transformer 块中所有线性投影,其中查询/键投影与前馈及输出投影采用不同的增益因子。
  • 在所有模态——语言、视觉、语音和多模态——中使用相同的架构与初始化策略,无需架构再调优。
  • 采用标准优化流程进行端到端训练,利用 Sub-LN 和初始化带来的稳定性,支持更高的学习率。
  • 在多样化任务上评估该方法:掩码语言建模(BERT)、因果语言建模(GPT)、机器翻译、掩码图像建模(BEiT)、语音识别(T-T)以及视觉-语言预训练(BEiT-3)

实验结果

研究问题

  • RQ1单一 Transformer 架构是否能在无需架构特化的情况下,在语言、视觉、语音和多模态任务中均实现最先进性能?
  • RQ2与后归一化(Post-LN)和前归一化(Pre-LN)变体相比,子层归一化是否能提升表达能力与优化稳定性?
  • RQ3基于理论推导的初始化策略是否能确保在扩展过程中训练稳定,尤其对更深的模型?
  • RQ4所提出的 Foundation Transformer 是否能在不发散的情况下支持更高的学习率,从而提升训练效率?
  • RQ5在多模态预训练中,如视觉-语言任务,该统一架构是否能超越模态专用变体?

主要发现

  • 在 12 层和 24 层模型的 ImageNet 验证集上,Magneto 分别比 Pre-LN 基线高出 0.4% 和 0.6%,且在所有 ImageNet 变体上均超越 ViT。
  • 在 ADE20k 语义分割任务中,Magneto 达到 52.2% mIoU(12 层)和 54.6% mIoU(24 层),分别比原始 ViT 提升 0.8% 和 1.0%。
  • 在语音识别任务(LibriSpeech 960h)中,Magneto 在 18L 和 36L 设置下,词错误率(WER)均较 Pre-LN 基线降低超过 6%。
  • 在视觉-语言任务中,与 Pre-LN 相比,Magneto 在测试标准划分上将 VQA 准确率提升 0.5%,在测试集上将 NLVR2 准确率提升 0.8%。
  • 对于 36L 模型,Magneto 允许的最大学习率为 3e-3,而 Pre-LN 基线仅限于 1.5e-3,证明其优化稳定性更优。
  • 该模型在所有评估模态中均保持一致的性能增益,证实其作为真正通用基础架构的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。