[论文解读] Audio-visual Generalised Zero-shot Learning with Cross-modal Attention and Language
本论文提出AVCA,一种用于音视频广义零样本学习(GZSL)的跨模态注意力模型,通过将音视频嵌入与文本标签嵌入对齐,实现性能突破。通过利用模态间的交叉注意力机制和一种新颖的损失函数,AVCA在三个新基准数据集——VGGSound、UCF101和ActivityNet上均取得了最先进(SOTA)的性能表现,尤其在未见类别上的表现显著优于先前方法。
Learning to classify video data from classes not included in the training data, i.e. video-based zero-shot learning, is challenging. We conjecture that the natural alignment between the audio and visual modalities in video data provides a rich training signal for learning discriminative multi-modal representations. Focusing on the relatively underexplored task of audio-visual zero-shot learning, we propose to learn multi-modal representations from audio-visual data using cross-modal attention and exploit textual label embeddings for transferring knowledge from seen classes to unseen classes. Taking this one step further, in our generalised audio-visual zero-shot learning setting, we include all the training classes in the test-time search space which act as distractors and increase the difficulty while making the setting more realistic. Due to the lack of a unified benchmark in this domain, we introduce a (generalised) zero-shot learning benchmark on three audio-visual datasets of varying sizes and difficulty, VGGSound, UCF, and ActivityNet, ensuring that the unseen test classes do not appear in the dataset used for supervised training of the backbone deep models. Comparing multiple relevant and recent methods, we demonstrate that our proposed AVCA model achieves state-of-the-art performance on all three datasets. Code and data are available at \url{https://github.com/ExplainableML/AVCA-GZSL}.
研究动机与目标
- 解决在音视频零样本学习(ZSL)中对未见类别视频数据进行分类的挑战,即模型必须在未见过的训练类别上实现泛化。
- 克服现有ZSL基准中训练集、验证集与测试集之间存在类别重叠的问题,从而导致过拟合与性能虚高。
- 利用三个多样化数据集——VGGSound、UCF101和ActivityNet,构建一个统一且真实的音视频GZSL基准,确保训练集与测试集之间无类别泄露。
- 设计一种计算高效的多流模型,通过交叉注意力机制融合音视频特征,同时保留单模态信息。
- 证明多模态表征在零样本泛化任务中显著优于单模态基线模型,尤其在未见类别上表现更优。
提出的方法
- 提出AVCA,一种具有独立音视频编码器的多流神经网络,通过交叉注意力机制在模态间交换信息,构建联合表征。
- 使用自监督SeLaVi模型预提取的音视频特征,避免监督预训练导致的信息泄露。
- 采用基于三元组对比损失与正则化损失($l_c$)相结合的方式训练模型,以在融合表征中保留显著的单模态特征。
- 通过交叉注意力将最终的音视频嵌入与文本标签嵌入对齐,实现零样本预测,即通过寻找最匹配的标签嵌入完成分类。
- 引入一种新颖的训练目标,促使模型关注相关跨模态线索,同时保持单模态的判别性信息。
- 在广义ZSL设置下,采用调和平均(HM)与零样本学习(ZSL)准确率作为评估指标,其中所有训练类别均作为测试集中的干扰项存在。
实验结果
研究问题
- RQ1当测试类别无任何训练样本时,音视频流之间的跨模态注意力是否能提升视频分类中的零样本泛化能力?
- RQ2结合文本标签嵌入与音视频表征,是否能相比单模态或非注意力机制的多模态方法,在未见类别上取得更优性能?
- RQ3在无训练集与测试集类别重叠的真实世界音视频数据集上,所提出的AVCA模型相较于SOTA方法在广义零样本学习(GZSL)中的表现如何?
- RQ4引入一种保留单模态信息的正则化损失,能在多大程度上提升多模态ZSL模型的鲁棒性与性能?
- RQ5能否从现有数据集如VGGSound、UCF101和ActivityNet中构建一个统一的音视频GZSL基准,以确保无数据泄露的真实评估条件?
主要发现
- 在VGGSound-GZSL基准上,AVCA取得6.31%的调和平均(HM)与6.00%的零样本学习(ZSL)准确率,优于AVGZSLNet(HM: 5.83%,ZSL: 5.28%)与DEVISE(HM: 5.00%,ZSL: 4.50%)。
- 在UCF-GZSL上,AVCA取得HM: 27.15%与ZSL: 20.01%,显著优于AVGZSLNet(HM: 18.05%,ZSL: 13.65%)与DEVISE(HM: 15.00%,ZSL: 12.00%)。
- 在ActivityNet-GZSL上,AVCA取得HM: 12.13%与ZSL: 9.13%,远超AVGZSLNet(HM: 8.30%,ZSL: 6.39%)与DEVISE(HM: 7.00%,ZSL: 5.50%)。
- 消融实验表明,移除交叉注意力会降低性能,而加入$l_c$损失与交叉注意力可使结果优于AVGZSLNet,证明了所提组件的有效性。
- 同时使用音频与视觉分支的训练,相比仅使用任一模态,能显著提升已见(S)与未见(U)类别的性能,HM从视觉单模态的7.53%提升至ActivityNet-GZSL上的12.13%。
- AVCA参数量为1.69M,计算量为2.36 GFLOPS,计算效率高,与AVGZSLNet(1.32M参数,1.38 GFLOPS)相当,且在所有基准上均取得显著更优的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。