[论文解读] Efficient Multimodal Fusion via Interactive Prompting
本文提出PMF,一种内存高效的多模态融合方法,通过在单模态Transformer的深层使用交互式提示(prompt),实现灵活的双向跨模态交互。通过将提示解耦为查询、上下文和融合三种类型,并仅训练这些深层向量,PMF在仅使用不到3%的可训练参数的情况下,实现了与全微调相当的性能,同时训练内存使用量降低高达66%。
Large-scale pre-training has brought unimodal fields such as computer vision and natural language processing to a new era. Following this trend, the size of multi-modal learning models constantly increases, leading to an urgent need to reduce the massive computational cost of finetuning these models for downstream tasks. In this paper, we propose an efficient and flexible multimodal fusion method, namely PMF, tailored for fusing unimodally pre-trained transformers. Specifically, we first present a modular multimodal fusion framework that exhibits high flexibility and facilitates mutual interactions among different modalities. In addition, we disentangle vanilla prompts into three types in order to learn different optimizing objectives for multimodal learning. It is also worth noting that we propose to add prompt vectors only on the deep layers of the unimodal transformers, thus significantly reducing the training memory usage. Experiment results show that our proposed method achieves comparable performance to several other multimodal finetuning methods with less than 3% trainable parameters and up to 66% saving of training memory usage.
研究动机与目标
- 解决为下游任务微调大型多模态模型所带来的高计算与内存开销问题。
- 克服现有提示微调方法的局限性,这些方法虽减少了参数更新量,但因在完整模型深度上计算梯度,未能显著降低内存使用。
- 在无需成对多模态数据的情况下,实现视觉与语言编码器之间的双向、灵活的跨模态交互。
- 通过仅将提示更新限制在单模态Transformer的深层,降低训练期间的内存消耗。
- 开发一种模块化框架,支持单模态编码器的即插即用替换,并可扩展至新增模态。
提出的方法
- 提出一种双流、并行的模块化融合框架,其中视觉与语言编码器独立运行,并通过类似交叉注意力的机制进行交互。
- 引入三种交互式提示:查询提示、查询上下文提示和融合上下文提示,每类提示在跨模态信息交换中承担不同角色。
- 采用非线性映射函数,将一种模态的“答案”转换为另一种模态的表示,实现动态、上下文感知的模态间交互。
- 仅将提示向量限制在单模态Transformer的深层(如L-2层),从而减少反向传播的深度,显著降低梯度内存使用。
- 采用模块化设计,支持单模态编码器(如BERT、T5、ViT)的即插即用替换,并支持新模态的集成。
- 应用神经架构搜索(NAS)自动识别最优融合层与提示长度,以在最小化超参数调优的前提下提升性能。
实验结果
研究问题
- RQ1基于提示的方法能否在大幅降低训练内存使用的同时,实现与全微调相当的性能?
- RQ2将提示更新限制在单模态Transformer的深层,对内存效率与模型性能有何影响?
- RQ3双向、交互式提示机制是否能超越单向对齐方式,提升多模态模型的跨模态理解能力?
- RQ4PMF的模块化设计在支持灵活模型替换与多模态扩展方面,其能力达到何种程度?
- RQ5自动超参数搜索(如NAS)是否能在多样化的视觉-语言基准上提升PMF的性能?
主要发现
- 与全微调基线相比,PMF将训练内存使用量降低高达66%,与基于提示的方法相比降低55%,同时可训练参数占比不足3%。
- 在MM-IMDB、SNLI-VE和UPMC-Food101三个基准数据集上,PMF表现具有竞争力,MM-IMDB的F1-Macro得分为61.66,SNLI-VE的准确率为59.67%。
- 即使在使用更大规模的单模态编码器(如BERT-large和ViT-large)时,PMF仍保持高性能,内存使用仅略有增加(从12.84GB增至18.44GB)。
- 提示长度消融实验表明,M=16时性能最优;当提示长度增至M=32时性能下降,尽管内存开销仅从M=1到M=16增加约1GB。
- NAS优化的PMF(PMF-NAS)在所有三个数据集上的表现均优于标准PMF,证明了自动化结构搜索在超参数配置中的价值。
- 融合层位置(如L-2)是影响内存使用的主要因素,而非提示长度,进一步验证了深层提示在内存优化方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。