Skip to main content
QUICK REVIEW

[论文解读] TaCA: Upgrading Your Visual Foundation Model with Task-agnostic Compatible Adapter

Binjie Zhang, Yixiao Ge|arXiv (Cornell University)|Jun 22, 2023
Multimodal Machine Learning ApplicationsComputer Science被引用 3
一句话总结

本文提出 TaCA,一种与任务无关的兼容适配器,可在不微调下游模块的情况下实现视觉基础模型的无缝热插拔升级。通过参数高效的微调方法,将新基础模型的潜在表征与旧模型对齐,TaCA 在视频-文本检索、视频分类和视觉问答任务中均实现性能提升,其中在 MSR-VTT 上最高提升 +5.1%,在 Kinetics-400 上最高提升 +2.2%。

ABSTRACT

Visual foundation models like CLIP excel in learning feature representations from extensive datasets through self-supervised methods, demonstrating remarkable transfer learning and generalization capabilities. A growing number of applications based on visual foundation models are emerging, including innovative solutions such as BLIP-2. These applications employ pre-trained CLIP models as upstream feature extractors and train various downstream modules to accomplish diverse tasks. In situations involving system upgrades that require updating the upstream foundation model, it becomes essential to re-train all downstream modules to adapt to the new foundation model, which is inflexible and inefficient. In this paper, we introduce a parameter-efficient and task-agnostic adapter, dubbed TaCA, that facilitates compatibility across distinct foundation models while ensuring enhanced performance for the new models. TaCA allows downstream applications to seamlessly integrate better-performing foundation models without necessitating retraining. We conduct extensive experimental validation of TaCA using different scales of models with up to one billion parameters on various tasks such as video-text retrieval, video recognition, and visual question answering. The results consistently demonstrate the emergent ability of TaCA on hot-plugging upgrades for visual foundation models. Codes and models will be available at https://github.com/TencentARC/TaCA.

研究动机与目标

  • 解决升级视觉基础模型时重新训练下游模块效率低下且成本高昂的问题。
  • 实现在不修改下游组件的情况下,将改进后的基础模型无缝集成到现有系统中。
  • 开发一种与任务无关的适应机制,确保新旧基础模型在潜在空间中的兼容性。
  • 通过升级到更强的基础模型,在保持与现有下游模块兼容性的前提下,提升下游任务的性能。
  • 通过模块化框架(如 Flamingo 和 BLIP-2)在真实多模态系统中展示热插拔升级的可行性和有效性。

提出的方法

  • 在新视觉基础模型之上训练一个轻量级、参数高效的适配器(TaCA),以对齐其潜在表征与原始模型的表征。
  • 使用维度对齐投影器将新模型的特征映射到与旧模型表征相同的特征空间。
  • 通过蒸馏损失优化 TaCA,该损失最小化新旧视觉特征之间的 L2 距离,且仅依赖于旧模型的输出。
  • 将蒸馏损失与对比损失结合,利用新视觉特征与旧文本特征之间的交叉注意力,以保留跨模态对齐。
  • 冻结旧模型和新模型的主干参数,仅在训练期间微调适配器和投影器组件。
  • 在 Flamingo 和 BLIP-2 等模块化框架中应用该方法,将视觉编码器替换为经 TaCA 增强的模型,同时保持所有下游模块不变。

实验结果

研究问题

  • RQ1能否设计一种参数高效的适配器,实现在不微调下游模块的情况下对视觉基础模型进行热插拔升级?
  • RQ2当通过与任务无关的适配器集成时,新基础模型在多大程度上能提升下游性能?
  • RQ3TaCA 适配器在模型架构中的位置如何影响性能与兼容性?
  • RQ4在升级到更强的基础模型时,所提出的方法是否能保持或增强跨模态对齐(如图像-文本对齐)?
  • RQ5TaCA 是否能在视频-文本检索、视频分类和视觉问答等多种下游任务中实现泛化?

主要发现

  • 将 ViT-B/16 替换为 TaCA-ViT-H/14 后,MSR-VTT 上的文本到视频检索性能在 R@1 上提升了 +5.1%。
  • 相同升级在 Kinetics-400 视频分类任务的 Top-1 准确率上实现了 +2.2% 的提升。
  • 在 VQAv2 基准测试中,TaCA-ViT-H/14 在零样本视觉问答任务中比 OpenFlamingo(ViT-L/14)高出 +0.6%。
  • 在 ViT-H/14 模型的所有层(1–24)中插入 TaCA 适配器可获得最佳性能,在 MSR-VTT 上相比基线提升 +2.6%。
  • 将适配器置于浅层(1–12)的性能优于深层(13–24),表明早期层的适应对表征对齐更有效。
  • 该方法在 Flamingo 和 BLIP-2 等多个框架中均实现了稳定的性能提升,证明了其广泛的兼容性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。