[论文解读] Dynamic Tuning Towards Parameter and Inference Efficiency for ViT Adaptation
本文提出动态调优(DyT),一种用于视觉变换器(ViT)微调的新方法,可同时提升参数效率与推理效率。DyT 引入一个可学习的令牌调度器,在推理过程中通过识别并跳过信息量较少的令牌,动态地跳过冗余计算,同时利用轻量级适配器与专家混合(MoE)设计以维持性能。在 VTAB-1K 上,DyT 仅使用 43.52 GFLOPs(为基线模型 71%–85% 的 FLOPs)即可实现与全量微调相当或更优的准确率,证明了在不损失准确率的前提下显著提升了效率。
Existing parameter-efficient fine-tuning (PEFT) methods have achieved significant success on vision transformers (ViTs) adaptation by improving parameter efficiency. However, the exploration of enhancing inference efficiency during adaptation remains underexplored. This limits the broader application of pre-trained ViT models, especially when the model is computationally extensive. In this paper, we propose Dynamic Tuning (DyT), a novel approach to improve both parameter and inference efficiency for ViT adaptation. Specifically, besides using the lightweight adapter modules, we propose a token dispatcher to distinguish informative tokens from less important ones, allowing the latter to dynamically skip the original block, thereby reducing the redundant computation during inference. Additionally, we explore multiple design variants to find the best practice of DyT. Finally, inspired by the mixture-of-experts (MoE) mechanism, we introduce an enhanced adapter to further boost the adaptation performance. We validate DyT across various tasks, including image/video recognition and semantic segmentation. For instance, DyT achieves superior performance compared to existing PEFT methods while evoking only 71% of their FLOPs on the VTAB-1K benchmark.
研究动机与目标
- 为解决现有视觉变换器(ViT)参数高效微调(PEFT)方法在推理阶段计算量未降低的问题,尽管其在参数效率方面有所提升。
- 开发一种统一方法,在 ViT 微调过程中同时提升参数效率与推理效率,尤其适用于计算量较大的模型。
- 实现在图像识别、视频动作识别与语义分割等多样化视觉任务中的高效微调,且不损害性能。
- 探索适用于密集预测任务的动态令牌剪枝机制,且不减少令牌总数。
- 研究动态令牌跳过对模型性能的影响,并识别最优设计变体与超参数。
提出的方法
- 为每个 ViT 块引入一个可学习的令牌调度器,根据令牌的信息量决定其在推理过程中是否被激活或跳过。
- 仅被激活的令牌会通过原始变换器块与轻量级适配器;未激活的令牌仅由适配器处理,从而减少计算量。
- 采用 Gumbel-Softmax 重参数化方法,实现令牌调度器的可微分训练,支持端到端优化。
- 使用瓶颈适配器结合专家混合(MoE)机制,在几乎不增加额外 FLOPs 的前提下增强特征表示能力。
- 采用温度调度策略对 Gumbel-Softmax 进行优化,以提升训练稳定性和性能,温度从 5 逐渐衰减至 0.1。
- 设计四种模型变体,以评估不同激活率(r)对性能与效率的影响。
实验结果
研究问题
- RQ1在 ViT 微调过程中,推理阶段的动态令牌跳过是否能在不损失准确率的前提下降低计算成本?
- RQ2在多样化的视觉基准测试中,DyT 在准确率与 FLOPs 方面与全量微调及现有 PEFT 方法相比表现如何?
- RQ3令牌调度器的最优激活率与温度设置为何,可实现效率与性能的最佳平衡?
- RQ4所提出的动态调优机制是否能在包括识别、视频理解与密集预测在内的多种视觉任务中实现泛化?
- RQ5在相同参数与 FLOP 约束下,基于 MoE 的适配器相较于标准适配器在性能上是否有提升?
主要发现
- 在 VTAB-1K 基准上,DyT 以仅 43.52 GFLOPs 的计算量实现了 77.0% 的平均准确率,优于全量微调(75.7%),且 FLOPs 降低了 29.8%。
- 在 VTAB-1K 的 ViT-B/16 上,DyT 在性能上与现有 PEFT 方法相当或更优,同时仅消耗其 71%–85% 的 FLOPs。
- 在 K400 视频动作识别基准上,DyT 相较于基线方法减少了 37 GFLOPs 的 FLOPs,且泛化能力得到提升。
- 在 ADE20K 语义分割基准上,DyT 在 21 GFLOP 的 FLOP 减少下仍优于全量微调,证明其在密集预测任务中的强大性能。
- 令牌调度器成功学习到激活信息量高的令牌,尤其是在深层网络中,验证了其识别显著视觉特征的能力。
- 温度从 5 降至 0.1 的调度策略在 Food-101 与 K400 上提升了性能,表明自适应温度调节可增强训练动态。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。