Skip to main content
QUICK REVIEW

[论文解读] Cross-Modal Attention Consistency for Video-Audio Unsupervised Learning

Shaobo Min, Qi Dai|arXiv (Cornell University)|Jun 13, 2021
Music and Audio Processing参考文献 53被引用 5
一句话总结

本文提出了一种新颖的自监督掩码任务——跨模态注意力一致性(CMAC),通过将模态特定的注意力图与跨模态引导对齐,强制实现视觉与音频模态之间的双向局部对应关系。通过利用金字塔注意力机制和一种改进的对比损失(包含模态内负样本),CMAC在视频动作识别、检索和音频分类任务上实现了SOTA性能,且计算成本更低。

ABSTRACT

Cross-modal correlation provides an inherent supervision for video unsupervised representation learning. Existing methods focus on distinguishing different video clips by visual and audio representations. We human visual perception could attend to regions where sounds are made, and our auditory perception could also ground their frequencies of sounding objects, which we call bidirectional local correspondence. Such supervision is intuitive but not well explored in the contrastive learning framework. This paper introduces a pretext task, Cross-Modal Attention Consistency (CMAC), for exploring the bidirectional local correspondence property. The CMAC approach aims to align the regional attention generated purely from the visual signal with the target attention generated under the guidance of acoustic signal, and do a similar alignment for frequency grounding on the acoustic attention. Accompanied by a remoulded cross-modal contrastive loss where we consider additional within-modal interactions, the CMAC approach works effectively for enforcing the bidirectional alignment. Extensive experiments on six downstream benchmarks demonstrate that CMAC can improve the state-of-the-art performance on both visual and audio modalities.

研究动机与目标

  • 解决视频-音频自监督学习中缺乏细粒度局部对应监督的问题。
  • 在无需人工标注的情况下,建模双向局部对应关系——即视觉注意力聚焦于发声区域,音频注意力则针对显著物体产生的频段。
  • 通过强制模态特定注意力图与跨模态引导注意力图之间的一致性,提升视觉与音频表征学习效果。
  • 设计一种高效的对比学习框架,整合模态内交互关系,且无需额外内存开销。
  • 在计算资源友好的设置下,实现下游任务的SOTA性能。

提出的方法

  • CMAC引入金字塔注意力机制,利用一模态的自适应滤波器生成目标跨模态注意力图,以引导另一模态。
  • 将仅基于视觉信号的视觉编码器注意力图与音频引导的视觉注意力图对齐,反之亦然。
  • 通过强制单模态与跨模态注意力图之间的一致性,保留局部对应关系。
  • 采用一种改进的对比损失,包含来自前一批次数据的模态内负样本,避免额外内存开销。
  • 利用动态自适应滤波器学习模态特定的卷积核,以实现跨模态间注意力对齐。
  • 框架通过视频-音频对比学习端到端训练,结合数据增强,随后在下游任务上进行线性探测。

实验结果

研究问题

  • RQ1视觉区域与音频频段之间的双向局部对应关系,能否作为视频-音频表征学习中有效的自监督信号?
  • RQ2如何在无人工标注的情况下建模跨模态注意力一致性,以引导视觉与音频编码器关注相关时空区域与频谱区域?
  • RQ3与实例级对比学习相比,强制模态特定注意力图与跨模态引导注意力图之间的一致性,是否能提升下游任务性能?
  • RQ4一种包含模态内负样本的改进对比损失,能否在降低内存与计算成本的同时,实现优于现有方法的性能?
  • RQ5CMAC在动作识别、视频检索与音频分类任务中,对视觉与音频表征的提升程度如何?

主要发现

  • CMAC在UCF101与HMDB51动作识别任务上达到新的SOTA性能,分别超越GDT 1.0%与1.1%,且仅使用1/6的GPU计算成本与更小的批量大小。
  • 在视频检索任务中,CMAC在所有设置下均创下SOTA结果,表明由于对相关区域的注意力对齐,视觉表征更具判别性。
  • 在ESC50音频分类任务中,CMAC达到81.4%的准确率,较之前SOTA(78.6%)高出2.8%,且无需微调音频主干网络。
  • 在DCASE2013与DCASE2014数据集上,CMAC分别取得76%与96%的准确率,较GDT在后者上高出3%与2%,证明了音频表征学习的显著改进。
  • 该方法通过定位与视觉物体相关的频率成分,显著提升了音频表征学习能力,表现为注意力图更稀疏、更聚焦。
  • 即使在背景杂乱的复杂场景中,CMAC的有效性也得到验证,尽管在无标注条件下精确定位仍具挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。