Skip to main content
QUICK REVIEW

[论文解读] Audio-visual scene classification: analysis of DCASE 2021 Challenge submissions

Shanshan Wang, Toni Heittola|arXiv (Cornell University)|May 28, 2021
Music and Audio Processing参考文献 20被引用 5
一句话总结

本文分析了 DCASE 2021 挑战赛的音视频场景分类任务,使用来自 12 个欧洲城市的同步音视频数据集评估了 43 份提交结果。最佳系统通过利用大规模预训练模型(如 ResNet、EfficientNet)、迁移学习、数据增强和多模态融合,实现了 0.195 的对数损失和 93.8% 的准确率,显著优于基线模型(对数损失 0.662,准确率 77.1%)。

ABSTRACT

This paper presents the details of the Audio-Visual Scene Classification task in the DCASE 2021 Challenge (Task 1 Subtask B). The task is concerned with classification using audio and video modalities, using a dataset of synchronized recordings. This task has attracted 43 submissions from 13 different teams around the world. Among all submissions, more than half of the submitted systems have better performance than the baseline. The common techniques among the top systems are the usage of large pretrained models such as ResNet or EfficientNet which are trained for the task-specific problem. Fine-tuning, transfer learning, and data augmentation techniques are also employed to boost the performance. More importantly, multi-modal methods using both audio and video are employed by all the top 5 teams. The best system among all achieved a logloss of 0.195 and accuracy of 93.8%, compared to the baseline system with logloss of 0.662 and accuracy of 77.1%.

研究动机与目标

  • 评估并分析提交至 DCASE 2021 挑战赛的音视频场景分类系统的性能。
  • 识别在多模态场景分类中表现最佳的系统所采用的最有效技术与架构。
  • 从性能和鲁棒性角度,对比单模态(仅音频、仅视频)与多模态方法的表现。
  • 评估模型复杂度、迁移学习和数据增强对系统泛化能力和准确率的影响。

提出的方法

  • 本研究使用来自 12 个欧洲城市的同步音视频数据集,评估了来自 13 支国际团队的 43 份提交结果。
  • 基线系统使用对数梅尔倒谱图表示音频,使用标准卷积神经网络处理视频,采用早期融合策略,并在 TAU Urban Audio-Visual Scenes 2021 数据集上进行训练。
  • 表现最佳的系统采用大型预训练模型(如 ResNet 和 EfficientNet),并通过迁移学习在任务上进行微调。
  • 数据增强技术(如时间偏移、频率掩蔽和 mixup)被广泛使用,以提升模型鲁棒性。
  • 所有排名前五的团队均应用了多模态融合策略,通过晚期或早期融合机制结合音频与视频特征。
  • 性能通过在开发集和测试集上的对数损失与准确率进行评估,同时使用混淆矩阵和相关性分析进行结果解释。

实验结果

研究问题

  • RQ1在音视频场景分类任务中,哪些深度学习架构和预训练策略最为有效?
  • RQ2与单模态方法相比,多模态融合在性能和泛化能力方面表现如何?
  • RQ3数据增强和微调在多大程度上提升了系统的鲁棒性和准确率?
  • RQ4模型复杂度与系统性能之间存在何种关系?
  • RQ5表现最佳的系统在未见城市和场景类别上的泛化能力如何?

主要发现

  • 最佳系统实现了 0.195 的对数损失和 93.8% 的准确率,显著优于基线模型(对数损失 0.662,准确率 77.1%)。
  • 在 43 份提交中,超过一半的系统优于基线模型,表明该领域整体进展显著。
  • 仅视频模型的表现优于仅音频模型,最佳仅视频系统实现了 0.132 的对数损失和 91.6% 的准确率。
  • 最佳系统在 'park' 类别上达到 100% 准确率,在 'metro station' 类别上达到 99% 准确率,最低类别性能为 84%。
  • 模型复杂度与系统排名之间的斯皮尔曼等级相关系数为 0.75,表明两者存在强烈正相关关系。
  • 混淆矩阵显示,'airport' 常被误分类为 'shopping mall','tram' 常被误分类为 'bus' 或 'metro',反映出这些场景在感知上的相似性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。