[论文解读] Multi-branch Attentive Transformer
本文提出多分支注意力Transformer(MAT),一种新型Transformer变体,通过平均多个独立的多头注意力分支输出来提升性能。结合丢弃分支正则化与基于预训练单分支Transformer的近端初始化,MAT在机器翻译、代码生成和自然语言理解等任务中均取得显著性能提升,证明了多分支注意力在序列学习中的有效性。
While the multi-branch architecture is one of the key ingredients to the success of computer vision tasks, it has not been well investigated in natural language processing, especially sequence learning tasks. In this work, we propose a simple yet effective variant of Transformer called multi-branch attentive Transformer (briefly, MAT), where the attention layer is the average of multiple branches and each branch is an independent multi-head attention layer. We leverage two training techniques to regularize the training: drop-branch, which randomly drops individual branches during training, and proximal initialization, which uses a pre-trained Transformer model to initialize multiple branches. Experiments on machine translation, code generation and natural language understanding demonstrate that such a simple variant of Transformer brings significant improvements. Our code is available at \url{https://github.com/HA-Transformer}.
研究动机与目标
- 探索多分支架构在自然语言处理中的潜力,特别是针对序列学习任务。
- 解决尽管在计算机视觉中取得成功,但多分支设计在Transformer中仍被低估的问题。
- 通过结构化的架构扩展(超越标准多头注意力),提升模型泛化能力与性能。
- 开发有效的训练技术——丢弃分支与近端初始化,用于训练更深的多分支Transformer变体。
- 通过实证验证MAT在多样化的自然语言处理基准(包括机器翻译、代码生成与自然语言理解)中的有效性。
提出的方法
- MAT用多个独立的多头注意力分支替代标准多头注意力层,其输出通过平均形成最终输出。
- MAT中的每个分支均为标准多头注意力层,共享输入查询、键和值,但具有独立学习的参数。
- 训练过程中应用丢弃分支正则化,随机丢弃个别分支以防止共适应并提升泛化能力。
- 近端初始化使用预训练的单分支Transformer初始化MAT的多个分支,稳定训练并提升收敛性。
- 该架构保持与标准Transformer相同的输入与输出维度,支持直接比较与即插即用。
- 该方法同时利用头内拼接(within each head)与分支间平均(across branches),形成多分支注意力机制。
实验结果
研究问题
- RQ1受计算机视觉启发的多分支注意力机制,能否提升机器翻译与代码生成等序列学习任务的性能?
- RQ2丢弃分支正则化如何影响多分支Transformer的训练稳定性和泛化能力?
- RQ3从预训练的单分支Transformer进行近端初始化,是否能提升MAT的收敛性与性能?
- RQ4多分支注意力带来的性能增益是否仅限于注意力层,还是也能扩展到前馈网络?
- RQ5超参数(如分支数量与隐藏维度)如何影响MAT在不同自然语言处理任务中的性能?
主要发现
- 在机器翻译任务中,MAT相较标准Transformer取得显著提升,IWSLT En→De任务BLEU分数最高提升0.60,IWSLT De→En任务提升0.50。
- 在IWSLT Fr→En翻译任务中,采用近端初始化与丢弃分支的MAT在使用3个分支和1024前馈维度时,相比基线模型BLEU分数提升1.33点。
- 在IWSLT En→Fr任务中,采用随机丢弃头(一种丢弃分支形式)的变体在使用4个分支和2048前馈维度时,BLEU分数提升0.48点。
- 在代码生成任务中,MAT优于标准Transformer,表明其在多样化自然语言处理任务中具有持续性能增益。
- 研究发现,将多个分支引入前馈网络会轻微降低性能,表明多分支设计在注意力层中效果最佳。
- 近端初始化在所有评估设置中均一致提升MAT性能,增益范围为0.15至1.33 BLEU点,具体取决于任务与配置。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。