[论文解读] Revisiting Pre-training in Audio-Visual Learning
本文识别出预训练模型在视听学习中被低估的原因:异常的批量归一化(BatchNorm)参数以及单模态编码器之间的负面干扰。为此,提出自适应批量归一化重新初始化(ABRi)以解决死通道问题,并提出两阶段融合微调策略以提升跨模态协作,从而在Kinetics-Sounds、AVE和UCF-101等数据集上实现一致的性能提升。
Pre-training technique has gained tremendous success in enhancing model performance on various tasks, but found to perform worse than training from scratch in some uni-modal situations. This inspires us to think: are the pre-trained models always effective in the more complex multi-modal scenario, especially for the heterogeneous modalities such as audio and visual ones? We find that the answer is No. Specifically, we explore the effects of pre-trained models on two audio-visual learning scenarios: cross-modal initialization and multi-modal joint learning. When cross-modal initialization is applied, the phenomena of "dead channel" caused by abnormal Batchnorm parameters hinders the utilization of model capacity. Thus, we propose Adaptive Batchnorm Re-initialization (ABRi) to better exploit the capacity of pre-trained models for target tasks. In multi-modal joint learning, we find a strong pre-trained uni-modal encoder would bring negative effects on the encoder of another modality. To alleviate such problem, we introduce a two-stage Fusion Tuning strategy, taking better advantage of the pre-trained knowledge while making the uni-modal encoders cooperate with an adaptive masking method. The experiment results show that our methods could further exploit pre-trained models' potential and boost performance in audio-visual learning.
研究动机与目标
- 探究预训练模型在复杂视听多模态学习中是否依然有效,特别是在异质模态场景下。
- 诊断预训练模型在跨模态初始化与多模态联合学习场景中表现不佳的原因。
- 解决预训练模型被低估的根本原因:异常的BatchNorm参数以及单模态编码器之间的负面干扰。
- 提出ABRi以缓解死通道问题,并提出两阶段融合微调策略以增强编码器协作,同时保持表征质量。
- 在多样化的视听基准和模态上验证所提方法的有效性与泛化能力。
提出的方法
- 提出自适应批量归一化重新初始化(ABRi),以纠正导致跨模态初始化中出现死通道的异常BatchNorm参数。
- ABRi通过学习到的参数自适应地初始化BatchNorm层,以恢复模型容量并加速收敛。
- 引入两阶段融合微调策略:第一阶段,分别微调每个单模态编码器以释放预训练知识;第二阶段,通过样本自适应掩码联合微调两个编码器。
- 自适应掩码机制在联合训练过程中动态抑制信息量较少的模态特征,以平衡学习过程并减少干扰。
- 将ABRi与融合微调联合应用于多模态模型,以同时解决模型容量与知识利用问题。
- 将方法扩展至不同模态(如UCF-101上的RGB与光流)及复杂交互模块(如AVE上的AGVA与PSP),验证其泛化能力。
实验结果
研究问题
- RQ1为何尽管在单模态任务中表现优异,预训练模型在视听学习中仍表现欠佳?
- RQ2在使用音频预训练模型进行视觉任务时,为何跨模态初始化会失败,其根本原因是什么?
- RQ3在多模态联合学习中,强预训练编码器的存在如何负面影响另一模态的表征质量?
- RQ4对BatchNorm层进行自适应重新初始化是否能提升预训练视听模型的收敛速度与性能?
- RQ5结合自适应掩码的两阶段微调策略能否增强单模态编码器之间的协作,同时保留其预训练知识?
主要发现
- ABRi在CIFAR-100上显著提升性能,使用VGGSound预训练模型时准确率达到78.1%,优于从零开始训练的基线。
- 在Kinetics-Sounds上,结合ABRi的两阶段融合微调策略将准确率提升至74.13%(VGGSound预训练)和71.89%(ImageNet预训练),优于基线联合训练。
- 在Kinetics-Sounds上对音频和视觉编码器同时应用ABRi导致性能下降,表明过度优化主导模态(音频)会损害视觉学习。
- 在AVE数据集上,融合微调策略实现2.1%的绝对准确率提升(74.13% vs. 72.64%)以及2.1%的mAP提升(89.00 vs. 86.49),优于联合训练。
- 在UCF-101上,结合ABRi的两阶段融合微调策略实现83.62%的准确率,较决策融合提升2.13%,较联合训练提升4.69%,表明其在非视听模态上的泛化能力。
- 消融实验表明,在Kinetics-Sounds中,知识未被充分利用是主要瓶颈,而非死通道问题,因为仅使用ABRi仅带来微小性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。