[论文解读] CNN Architectures for Large-Scale Audio Classification
本文在包含30,871个标签的7000万视频数据集(YouTube-100M)上评估了标准卷积神经网络(CNN)架构——AlexNet、VGG、Inception和ResNet——在大规模音频分类任务中的表现。研究结果表明,通过将基于图像的CNN模型迁移至音频任务(使用对数梅尔倒谱图作为输入),可在声学事件检测(AED)任务中实现最先进性能,使用ResNet嵌入在Audio Set数据集上使mAP提升1.3倍。
Convolutional Neural Networks (CNNs) have proven very effective in image classification and show promise for audio. We use various CNN architectures to classify the soundtracks of a dataset of 70M training videos (5.24 million hours) with 30,871 video-level labels. We examine fully connected Deep Neural Networks (DNNs), AlexNet [1], VGG [2], Inception [3], and ResNet [4]. We investigate varying the size of both training set and label vocabulary, finding that analogs of the CNNs used in image classification do well on our audio classification task, and larger training and label sets help up to a point. A model using embeddings from these classifiers does much better than raw features on the Audio Set [5] Acoustic Event Detection (AED) classification task.
研究动机与目标
- 探究最先进的图像分类CNN架构是否可有效应用于大规模音频分类任务。
- 评估训练集规模和标签词表大小对音频分类性能的影响。
- 评估从大规模音频模型中学习到的表征在下游声学事件检测(AED)任务中的可迁移性。
- 确定帧级预测的简单平均是否优于更复杂的时序建模方法,用于视频级分类。
提出的方法
- 从7000万个YouTube视频中提取非重叠的960ms音频帧,并继承所有视频级标签。
- 将每个音频帧转换为对数梅尔倒谱图,作为预训练CNN的2D图像输入。
- 在不同规模的训练数据子集和标签集合上,对多种CNN架构(AlexNet、VGG、Inception、ResNet-50)进行训练与评估。
- 在30,000标签模型中,于最终层前使用128个单元的瓶颈层以加速训练。
- 通过平均帧级分类器输出生成完整音轨的预测结果,模仿视觉视频分类方法。
- 在Audio Set数据集上,使用原始对数梅尔特征和最佳性能ResNet模型的嵌入表示,对全连接网络进行微调。
实验结果
研究问题
- RQ1当应用于大规模音频分类任务时,标准的基于图像的CNN架构表现如何?
- RQ2增加训练集规模和标签词表大小如何影响模型泛化能力和性能?
- RQ3从大规模音频分类任务中学到的表征是否能提升下游声学事件检测(AED)任务的性能?
- RQ4帧级预测的简单平均是否足以实现视频级分类,还是需要更复杂的时序建模?
主要发现
- ResNet-50在所评估的架构中表现最佳,优于更简单的DNN以及AlexNet和VGG等早期CNN。
- 在更大标签集(最高达30,000个)上进行训练,在较小的评估集上带来了适度但一致的性能提升,表明具有正则化优势。
- 将训练集规模从23,000提升至7000万视频,显著改善了性能,且在70万至7000万视频规模的模型表现几乎相同,表明在某一规模后收益递减。
- 在30,000个标签上训练的7000万视频模型,使用ResNet嵌入在Audio Set数据集上实现了0.314的平衡mAP和0.959的AUC,相比对数梅尔基线(mAP为0.137)提升了135%。
- 在较小数据集(如70,000和23,000个视频)上训练的模型与7000万视频模型之间的性能差距表明存在过拟合现象,可通过更强的正则化或数据增强缓解。
- 帧级预测的简单平均方法表现几乎与更复杂的时序建模方法相当,表明局部帧级表征对视频级分类已具备高度判别力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。