[论文解读] READ: Recurrent Adaptation of Large Transformers
READ 通过在冻结的主干网络旁插入一个轻量级的 RNN 侧网络,提出了一种针对大型 Transformer 模型的轻量化、内存高效的微调方法。该侧网络可适应特定任务的输入,且无需对冻结的主干网络进行反向传播。与全参数微调相比,READ 将训练内存降低 56%,GPU 能耗减少 84%,且模型大小和推理延迟均无增加。
Fine-tuning large-scale Transformers has led to the explosion of many AI applications across Natural Language Processing and Computer Vision tasks. However, fine-tuning all pre-trained model parameters becomes impractical as the model size and number of tasks increase. Parameter-efficient transfer learning (PETL) methods aim to address these challenges. While effective in reducing the number of trainable parameters, PETL methods still require significant energy and computational resources to fine-tune. In this paper, we introduce extbf{RE}current extbf{AD}aption (READ) -- a lightweight and memory-efficient fine-tuning method -- to overcome the limitations of the current PETL approaches. Specifically, READ inserts a small RNN network alongside the backbone model so that the model does not have to back-propagate through the large backbone network. Through comprehensive empirical evaluation of the GLUE benchmark, we demonstrate READ can achieve a $56\%$ reduction in the training memory consumption and an $84\%$ reduction in the GPU energy usage while retraining high model quality compared to full-tuning. Additionally, the model size of READ does not grow with the backbone model size, making it a highly scalable solution for fine-tuning large Transformers.
研究动机与目标
- 解决大规模 Transformer 模型微调带来的高计算与内存开销问题,尤其是在模型规模和任务数量增长时。
- 克服现有参数高效迁移学习(PETL)方法的局限性,这些方法仍因需对大型主干网络进行反向传播而消耗大量能量和内存。
- 消除先前侧网络微调方法(如 Ladder-Side Tuning)中对侧网络预训练的依赖。
- 开发一种可扩展的轻量化解决方案,在显著降低训练资源消耗的同时保持高模型性能。
- 通过最小化内存和能耗,使微调后的大型模型能够在资源受限环境中实现实际部署。
提出的方法
- 在冻结的 Transformer 主干网络旁插入一个小型可训练 RNN 网络(READ),在缓存的中间激活上运行。
- 使用 Joiner 网络将多种信息源(如输入嵌入和中间隐藏状态)整合为每层的 RNN 输入。
- 独立地对主干网络和 READ 网络执行前向传播,缓存中间表示以避免重复计算。
- 在编码器和解码器各层中迭代计算 RNN 隐藏状态,然后将 RNN 输出加到主干网络输出上,生成最终预测。
- 仅训练 RNN 参数和最终分类头,冻结所有主干权重,以减少参数更新和反向传播开销。
- 无需预训练侧网络,与 Ladder-Side Tuning 不同,直接从零开始初始化并训练 RNN。

实验结果
研究问题
- RQ1轻量级 RNN 侧网络是否能在显著降低内存和能耗的同时,实现与全参数微调相当的性能?
- RQ2在侧微调方法中,消除对侧网络预训练的需求是否能提升效率与可扩展性?
- RQ3READ 与现有 PETL 方法(如 LoRA、适配器、提示微调)相比,在内存、能耗和推理延迟方面表现如何?
- RQ4READ 是否能在包括 GLUE 在内的多样化自然语言处理基准上保持高模型质量,且不增加模型大小或推理开销?
- RQ5READ 的性能与效率是否在不同主干模型规模(包括大模型和 3B 参数的 T5 模型)下均具有可扩展性?
主要发现
- 在 GLUE 基准上,READ 相较于全参数微调,将峰值训练内存消耗降低了 56%。
- READ 相较于全参数微调,实现了 84% 的 GPU 能耗降低,显著降低了训练成本。
- 该方法在所有 7 个 GLUE 任务上均保持了具有竞争力的模型准确率,与全参数微调及其他 PETL 方法相当或更优。
- READ 在推理阶段不引入任何额外延迟或内存开销,因为 RNN 仅在训练期间激活。
- READ 网络的大小不随主干模型规模增长,使其在大规模 Transformer 模型中具有高度可扩展性。
- READ 在效率与简洁性上均优于 Ladder-Side Tuning(LST),避免了对侧网络的预训练,同时降低了训练复杂度。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。