[论文解读] Conditional Adapters: Parameter-efficient Transfer Learning with Fast Inference
本文提出条件适配器(CoDA),一种参数高效的迁移学习方法,通过软 top-k 路由机制选择性地激活重要输入标记,从而加速推理。CoDA 在自然语言处理、视觉和语音任务中实现 2 倍至 8 倍的推理加速,同时准确率损失极小或可忽略不计,使大型预训练模型无需微调即可高效部署。
We propose Conditional Adapter (CoDA), a parameter-efficient transfer learning method that also improves inference efficiency. CoDA generalizes beyond standard adapter approaches to enable a new way of balancing speed and accuracy using conditional computation. Starting with an existing dense pretrained model, CoDA adds sparse activation together with a small number of new parameters and a light-weight training phase. Our experiments demonstrate that the CoDA approach provides an unexpectedly efficient way to transfer knowledge. Across a variety of language, vision, and speech tasks, CoDA achieves a 2x to 8x inference speed-up compared to the state-of-the-art Adapter approaches with moderate to no accuracy loss and the same parameter efficiency.
研究动机与目标
- 为解决标准参数高效方法(如适配器)的效率问题,尽管参数更新减少,但推理速度仍保持完整。
- 在大型预训练模型的迁移学习中,同时实现参数效率与推理效率。
- 开发一种路由机制,动态选择仅最相关的输入标记进行密集计算,从而降低推理成本。
- 证明通过软 top-k 路由的条件计算可在显著提升速度的同时保持模型准确率。
- 展示现有密集模型可高效转换为 CoDA 模型,且几乎无需或完全无需路由模块预训练。
提出的方法
- CoDA 通过引入可学习路由模块扩展标准适配器,该模块对输入标记执行软 top-k 操作,仅选择稀疏的标记子集进行完整的 Transformer 计算。
- 路由模块采用熵正则化优化,支持可微分且快速的迭代标记选择计算。
- 仅被选中的标记通过完整的预训练 Transformer 块处理,其余标记则通过轻量级适配器层传递,从而减少计算量。
- 该方法保留预训练模型权重,仅微调少量新增参数,确保参数效率。
- 软 top-k 操作泛化了硬 top-k 方法,支持路由策略的端到端训练,以实现最优任务性能。
- CoDA 可与其它参数高效方法(如 LoRA)结合,进一步加速推理。
实验结果
研究问题
- RQ1条件计算能否在迁移学习中同时实现参数效率与推理效率?
- RQ2软 top-k 路由机制在不损失准确率的前提下,选择有意义输入标记进行稀疏计算的效果如何?
- RQ3现有密集预训练模型在几乎无需或完全无需额外训练的情况下,能多大程度上转换为 CoDA 模型?
- RQ4在多种模态下,CoDA 与标准适配器在速度-准确率权衡方面表现如何?
- RQ5CoDA 在输入稀疏性较高的任务(如文档和图像问答)中能否保持性能?
主要发现
- 在 OCR-VQA 上,CoDA 的推理速度相比标准适配器最高提升 8 倍,精确匹配准确率仅下降 0.1%。
- 在 Librispeech 上,CoDA 在不同模型尺寸下实现 2.2 倍至 19.4 倍的加速,同时保持 1.4%–2.8% 的词错误率,与完全微调基线模型相当。
- 在视觉任务中,当路由标记减少至序列长度的 1/16 时,CoDA 实现 13.5 倍加速,OCR-VQA 的 EM 准确率仅下降 1 分。
- 可视化结果表明,路由模块学会选择有意义、具代表性的图像块,同时避开空白等低信息区域。
- CoDA 在性能上可与完全微调模型(如 w2v-BERT、BEST-RQ)相媲美,同时推理速度显著更快,参数效率更高。
- 该方法几乎无需路由模块预训练,可实现对现有密集模型的快速转换,构建高效 CoDA 模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。