Skip to main content
QUICK REVIEW

[论文解读] Unified Multisensory Perception: Weakly-Supervised Audio-Visual Video Parsing

Yapeng Tian, Dingzeyu Li|arXiv (Cornell University)|Jul 21, 2020
Music and Audio Processing参考文献 70被引用 9
一句话总结

本文提出了一种弱监督的音视频视频解析框架,仅使用视频级别标签即可将视频分割为可听、可见及音视频事件。该框架引入了一种混合注意力网络以建模单模态与跨模态的时间上下文,采用注意力MMIL池化实现自适应的多模态特征聚合,并通过个体引导学习与标签平滑技术缓解模态偏差与噪声标签问题,在一个新的大规模LLP数据集上实现了优异性能。

ABSTRACT

In this paper, we introduce a new problem, named audio-visual video parsing, which aims to parse a video into temporal event segments and label them as either audible, visible, or both. Such a problem is essential for a complete understanding of the scene depicted inside a video. To facilitate exploration, we collect a Look, Listen, and Parse (LLP) dataset to investigate audio-visual video parsing in a weakly-supervised manner. This task can be naturally formulated as a Multimodal Multiple Instance Learning (MMIL) problem. Concretely, we propose a novel hybrid attention network to explore unimodal and cross-modal temporal contexts simultaneously. We develop an attentive MMIL pooling method to adaptively explore useful audio and visual content from different temporal extent and modalities. Furthermore, we discover and mitigate modality bias and noisy label issues with an individual-guided learning mechanism and label smoothing technique, respectively. Experimental results show that the challenging audio-visual video parsing can be achieved even with only video-level weak labels. Our proposed framework can effectively leverage unimodal and cross-modal temporal contexts and alleviate modality bias and noisy labels problems.

研究动机与目标

  • 为解决多感官统一理解的缺失,将音视频视频解析建模为弱监督任务。
  • 建模音频与视觉模态之间复杂的时序关系,包括异步性,以提升事件检测性能。
  • 通过新颖的训练策略缓解弱监督多模态学习中的模态偏差与噪声标签问题。
  • 仅使用视频级别标注即可实现对音频、视觉及音视频事件的精确时序边界预测。
  • 为统一多感官感知背景下的音视频视频解析提供新的基准与数据集。

提出的方法

  • 提出一种混合注意力网络(HAN),联合建模单模态时间递归、多模态共现关系以及音视频异步性。
  • 引入一种注意力MMIL池化机制,以自适应方式聚合不同时间尺度与模态下的有用音频与视觉特征。
  • 采用个体引导学习策略,通过强制各模态独立预测来减少模态偏差。
  • 应用标签平滑技术以降低预测的过度自信,减轻噪声视频级别标签的影响。
  • 采用弱监督学习范式,训练仅需视频级别事件标签。
  • 利用一个新构建的大规模数据集LLP,包含11,849个YouTube视频片段,涵盖25个类别,用于训练与评估。

实验结果

研究问题

  • RQ1仅使用视频级别弱标签是否能有效学习音视频视频解析?
  • RQ2如何联合建模单模态与跨模态的时间上下文以提升事件检测性能?
  • RQ3在弱监督多模态学习中,模态偏差能在多大程度上被缓解?
  • RQ4标签平滑在音视频解析中如何提升对噪声视频级别标注的鲁棒性?
  • RQ5精确的音视频视频解析与时序边界检测能实现哪些实际应用?

主要发现

  • 所提出的框架仅使用视频级别弱标签即在音视频视频解析任务中取得优异性能,证明了该任务弱监督学习的可行性。
  • 混合注意力网络能有效捕捉同步与异步的音视频事件模式,优于忽略时序异步性的模型。
  • 个体引导学习策略显著降低了模态偏差,提升了以音频或视觉为主事件的性能。
  • 标签平滑提升了模型鲁棒性,而基于自举的标签更新策略则因错误传播导致性能下降。
  • LLP数据集支持大规模评估,并为具有精确时序标注的音视频视频解析建立了新基准。
  • 该框架支持新型应用,如异步声音分离与音视频场景感知的视频理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。