[论文解读] Distilling Audio-Visual Knowledge by Compositional Contrastive Learning
该论文提出了一种新型知识蒸馏框架——组合对比学习(CCL),通过学习组合嵌入以弥合跨模态语义鸿沟,将异构的音频、图像和视频表征知识迁移至视频表征学习中,从而提升视频表征学习性能。CCL在UCF101、ActivityNet和VGGSound数据集上均优于当前最先进方法,在视频识别任务中实现了最高达4.5%的准确率提升,通过在共享潜在空间中联合对比学习并引入类别感知监督实现。
Having access to multi-modal cues (e.g. vision and audio) empowers some cognitive tasks to be done faster compared to learning from a single modality. In this work, we propose to transfer knowledge across heterogeneous modalities, even though these data modalities may not be semantically correlated. Rather than directly aligning the representations of different modalities, we compose audio, image, and video representations across modalities to uncover richer multi-modal knowledge. Our main idea is to learn a compositional embedding that closes the cross-modal semantic gap and captures the task-relevant semantics, which facilitates pulling together representations across modalities by compositional contrastive learning. We establish a new, comprehensive multi-modal distillation benchmark on three video datasets: UCF101, ActivityNet, and VGGSound. Moreover, we demonstrate that our model significantly outperforms a variety of existing knowledge distillation methods in transferring audio-visual knowledge to improve video representation learning. Code is released here: https://github.com/yanbeic/CCL.
研究动机与目标
- 为解决在非受限环境下,从异构且无关联的音频与视觉模态向视频表征学习迁移知识的挑战。
- 弥合单模态教师网络(音频、图像、视频)与视频学生网络之间的跨模态语义鸿沟,尤其在模态之间未在时间或语义上对齐的情况下。
- 开发一种通用且统一的多模态蒸馏框架,适用于多种数据集和任务,且无需模态特定的对齐机制。
- 在UCF101、ActivityNet和VGGSound上建立全面的多模态蒸馏基准,以实现蒸馏方法之间的公平比较。
- 证明通过类别标签和组合嵌入联合对比不同模态的表征,相比标准对比学习或蒸馏基线,能够实现更丰富的知识迁移。
提出的方法
- 引入可学习的组合嵌入,将不同模态的表征映射到共享潜在空间,有效减少跨模态语义鸿沟。
- 采用多类别对比损失(NCE),在模态间对比正样本与负样本,并利用类别标签引导对齐。
- 使用Jensen-Shannon散度(JSD)损失对齐学生与教师网络的预测分布,确保输出空间中的知识迁移。
- 联合优化组合对比损失与JSD损失,实现在特征空间与预测空间中的联合对齐。
- 该方法具有通用性与模块化设计,可无缝集成任意模态的预训练教师网络(如图像使用ImageNet,音频使用LibriSpeech),且无架构限制。
- 该方法被应用于视频识别与检索任务,并在三个基准数据集上进行了广泛的消融实验与分析。
实验结果
研究问题
- RQ1组合对比学习能否有效实现从异构且无关联的音频与视觉模态向视频表征学习的知识迁移?
- RQ2在对比学习目标中引入类别标签,相较于实例级对比学习,如何提升多模态知识蒸馏性能?
- RQ3通过NCE与JSD损失在特征空间与预测空间中施加联合约束,其协同作用在多大程度上增强了知识迁移?
- RQ4当音频与视频在语义或时间上均未对齐时,模型在真实场景下的表现如何?
- RQ5当模态之间无相关性时,组合嵌入在弥合跨模态语义鸿沟方面起到了多大作用?
主要发现
- 在UCF101(A)设置下,CCL相比使用实例级对比损失的基线模型实现了4.5%的绝对准确率提升(64.9% vs. 60.4%),证明了类别感知对比学习的优势。
- 若移除NCE或JSD损失,性能分别显著下降1.8%与1.7%,表明两种损失具有互补性且对有效蒸馏至关重要。
- 在(AI)设置下,若移除NCE损失,准确率下降3.7%(从70.0%降至66.3%),证实其在特征级对齐中的关键作用。
- t-SNE可视化结果表明,CCL学习到了具有判别性的、按类别分离的视频表征,训练集与测试集的嵌入形成一致且聚类分明的流形结构。
- 在k-NN检索中,CCL能成功检索出相同或相似动作类别的视频,例如对“滑冰”查询可检索到“化眼妆”等相关动作视频。
- 视觉分析表明,得益于组合嵌入机制,CCL在音频与视频语义无关(如音乐配以无关动作)的情况下仍表现出良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。