Skip to main content
QUICK REVIEW

[论文解读] GLU Variants Improve Transformer

Noam Shazeer|arXiv (Cornell University)|Feb 12, 2020
Parallel Computing and Optimization Techniques参考文献 11被引用 20
一句话总结

本文提出了新型门控线性单元(GLU)变体——ReGLU、GEGLU、SwiGLU 和 Bilinear,用于替代 Transformer 前馈网络中的标准 ReLU 或 GELU 激活函数。这些变体在预训练和下游自然语言处理任务中提升了模型性能,其中 GEGLU 和 SwiGLU 在 GLUE、SuperGLUE 和 SQuAD 基准测试中均实现了更低的困惑度和更高的准确率。

ABSTRACT

Gated Linear Units (arXiv:1612.08083) consist of the component-wise product of two linear projections, one of which is first passed through a sigmoid function. Variations on GLU are possible, using different nonlinear (or even linear) functions in place of sigmoid. We test these variants in the feed-forward sublayers of the Transformer (arXiv:1706.03762) sequence-to-sequence model, and find that some of them yield quality improvements over the typically-used ReLU or GELU activations.

研究动机与目标

  • 通过用新型基于 GLU 的变体替换标准前馈网络激活函数,提升 Transformer 模型的性能。
  • 探究 GLU 组件中使用替代非线性激活函数是否能增强序列到序列模型中的表征学习能力。
  • 评估这些 GLU 变体对预训练目标和下游迁移学习任务的影响。
  • 在通过架构改进提升模型质量的同时,保持计算和参数效率。
  • 提供实证证据,表明 GLU 变体在多种自然语言处理基准测试中均能实现一致的性能提升。

提出的方法

  • 提出一类 GLU 变体,其中第一个线性投影通过非线性激活函数(如 sigmoid、ReLU、GELU、Swish)进行门控,输出与第二个线性投影逐元素相乘。
  • 定义了新的前馈网络组件:FFN_GLU、FFN_Bilinear、FFN_ReGLU、FFN_GEGLU、FFN_SwiGLU,分别使用 GLU 机制中的不同激活函数。
  • 通过将 GLU 模型中的隐藏维度从 3072 降低到 2048,保持参数量和计算量不变,与原始双权重前馈网络相当。
  • 采用 T5 模型架构和训练设置,包括 Adafactor 优化器和反平方根学习率调度策略,在预训练阶段不使用 Dropout 以提升性能。
  • 在 C4 语言建模填空预训练目标上评估模型,并在 GLUE、SuperGLUE 和 SQuAD 任务的混合数据集上进行微调。
  • 使用保留的验证集在预训练过程中测量对数困惑度,并报告下游基准测试的准确率分数。

实验结果

研究问题

  • RQ1在 Transformer 前馈网络中,使用 GELU 或 Swish 等替代激活函数的 GLU 变体是否能优于标准 ReLU 或 GELU?
  • RQ2是否可以通过将标准双权重前馈网络替换为三权重 GLU 架构,在不增加计算成本的前提下获得更优结果?
  • RQ3ReGLU、GEGLU、SwiGLU 和 Bilinear 等不同 GLU 变体在预训练损失和下游迁移学习性能方面表现如何?
  • RQ4使用 GLU 变体是否能在 GLUE、SuperGLUE 和 SQuAD 等多样化自然语言处理基准上实现一致的性能提升?
  • RQ5尽管未提供理论解释,为何某些 GLU 变体(如 GEGLU 和 SwiGLU)能实现更优性能?

主要发现

  • 在训练 524,288 步时,GEGLU 和 SwiGLU 变体分别实现了最低的保留对数困惑度 1.633 和 1.636,优于 ReLU 基线(1.677)。
  • 在 GLUE 基准测试中,GEGLU 实现了 86.17 的平均得分,超过 ReLU 基线(85.83)和原始 T5 模型(84.24)。
  • 在 SuperGLUE 基准测试中,SwiGLU 实现了 86.54 的最高平均得分,超过原始 T5 模型(78.56)和 ReLU 基线(77.88)。
  • 在 SQuAD v1.1 上,ReGLU 实现了最高的 EM 得分 83.53 和 F1 得分 91.18,优于 ReLU 基线(83.18 EM,90.87 F1)。
  • Bilinear 变体实现了第二低的困惑度(1.648)和在 SuperGLUE 上的强劲表现(平均 83.65),表明其虽缺乏非线性,但依然有效。
  • 所有 GLU 变体在多个基准测试中均表现出一致的性能提升,表明该架构改进增强了泛化能力和表征学习能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。