Skip to main content
QUICK REVIEW

[论文解读] VGGSound: A Large-scale Audio-Visual Dataset

Honglie Chen, Weidi Xie|arXiv (Cornell University)|Apr 29, 2020
Music and Audio Processing参考文献 28被引用 5
一句话总结

本文提出 VGG-Sound,一个大规模音视频数据集,包含 200,467 个 YouTube 视频片段,涵盖 309 个类别,通过基于计算机视觉的管道进行筛选,确保音视频对应关系并最小化标签噪声。该方法利用图像分类、音频验证和模型集成来自动化数据筛选,从而在原始语谱图上直接应用卷积神经网络(CNN)建立强大的音频识别基线模型。

ABSTRACT

Our goal is to collect a large-scale audio-visual dataset with low label noise from videos in the wild using computer vision techniques. The resulting dataset can be used for training and evaluating audio recognition models. We make three contributions. First, we propose a scalable pipeline based on computer vision techniques to create an audio dataset from open-source media. Our pipeline involves obtaining videos from YouTube; using image classification algorithms to localize audio-visual correspondence; and filtering out ambient noise using audio verification. Second, we use this pipeline to curate the VGGSound dataset consisting of more than 210k videos for 310 audio classes. Third, we investigate various Convolutional Neural Network~(CNN) architectures and aggregation approaches to establish audio recognition baselines for our new dataset. Compared to existing audio datasets, VGGSound ensures audio-visual correspondence and is collected under unconstrained conditions. Code and the dataset are available at http://www.robots.ox.ac.uk/~vgg/data/vggsound/

研究动机与目标

  • 开发一种可扩展的自动化管道,从开源视频中收集大规模音视频数据集,最大限度减少人工标注。
  • 筛选 VGG-Sound 数据集,包含超过 200,467 个视频片段,具备音视频对应关系和低标签噪声,适用于音频识别和多模态学习。
  • 在 VGG-Sound 上使用直接应用于原始语谱图的深度卷积神经网络(CNN)架构,建立强大的音频识别基线模型。
  • 在非受限、真实世界条件下,推动音频识别和音视频理解的研究。

提出的方法

  • 该管道从 YouTube 获取视频,并利用预训练的图像分类模型定位与声源对应的视觉区域。
  • 通过音频验证筛选片段,验证音视频对应关系,确保声源在视觉上可见。
  • 采用两阶段模型集成流程:首先在一半数据上训练音频分类器,并用于预测另一半数据,保留置信度最高的前三名预测结果作为高置信正样本。
  • 通过计算高置信正样本的视觉特征,并从剩余数据中检索视觉相似但音频被拒绝的片段,实现困难正样本挖掘。
  • 最终通过重新训练步骤,整合所有已确认的正样本,并从之前被拒绝的数据中检索更多片段,从而提升数据集的规模和多样性。
  • 通过去除尽管 YouTube ID 不同但视觉表征完全相同的片段,执行去重操作。
Fig. 1 : The top row in this figure shows example video frame and audio pairs of VGG-Sound classes, the bottom bar chart demostrates VGG-Sound classes with sizes of each audio class sorted by descending order.
Fig. 1 : The top row in this figure shows example video frame and audio pairs of VGG-Sound classes, the bottom bar chart demostrates VGG-Sound classes with sizes of each audio class sorted by descending order.

实验结果

研究问题

  • RQ1基于计算机视觉技术的全自动管道能否在极少人工干预下实现高质量的音视频数据集筛选?
  • RQ2在 VGG-Sound 上训练的音频识别模型性能与在 AudioSet 等其他数据集上训练的模型相比如何?
  • RQ3在弱监督设置下,模型集成和视觉检索在提升正样本音视频片段的质量和多样性方面有多大作用?
  • RQ4与浅层模型相比,更深的 CNN 架构在 VGG-Sound 数据集上的性能提升有多大?

主要发现

  • VGG-Sound 数据集包含 200,467 个视频片段,分布在 309 个类别中,每个类别至少包含 200 个片段,总时长达 550 小时。
  • 所提出的管道通过利用视觉一致性与模型集成,减少了标签噪声,实现了无需大量人工标注的高置信正样本选择。
  • Model-D(在完整 VGG-Sound 数据集上训练的更深 ResNet18)在 mAP 和 AUC 指标上优于仅在 AStest 子集上训练的 Model-A,表明在多样化数据上具有更好的泛化能力。
  • Model-D 与 Model-A 在 Top-5 准确率上的差距显著缩小,表明完整 VGG-Sound 数据集更能捕捉复杂、多声源的样本。
  • 结果表明,更深的 CNN 架构在 VGG-Sound 上优于浅层模型,其中 Model-C(更深)的性能优于 Model-B(更浅)。
  • 最终数据集保持了强音视频对应关系,每个 10 秒的片段均显示声音的视觉来源,可为音视频任务提供可靠的训练基础。
VGGSound: A Large-scale Audio-Visual Dataset

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。