Skip to main content
QUICK REVIEW

[论文解读] Audio Concept Classification with Hierarchical Deep Neural Networks

Mirco Ravanelli, Benjamin Elizalde|arXiv (Cornell University)|Oct 11, 2017
Music and Audio Processing参考文献 14被引用 3
一句话总结

该论文提出了一种分层深度神经网络(H-DNN)用于用户生成视频中的音频概念分类,通过49帧窗口结合短期上下文与级联神经网络实现长期调制。在TRECVID-MED数据集上,H-DNN相较于高斯混合模型(GMMs)实现了54%的相对提升,相较于最佳DNN基线模型实现了12%的提升,证明了分层深度学习在非受控环境下语义音频理解中的有效性。

ABSTRACT

Audio-based multimedia retrieval tasks may identify semantic information in audio streams, i.e., audio concepts (such as music, laughter, or a revving engine). Conventional Gaussian-Mixture-Models have had some success in classifying a reduced set of audio concepts. However, multi-class classification can benefit from context window analysis and the discriminating power of deeper architectures. Although deep learning has shown promise in various applications such as speech and object recognition, it has not yet met the expectations for other fields such as audio concept classification. This paper explores, for the first time, the potential of deep learning in classifying audio concepts on User-Generated Content videos. The proposed system is comprised of two cascaded neural networks in a hierarchical configuration to analyze the short- and long-term context information. Our system outperforms a GMM approach by a relative 54%, a Neural Network by 33%, and a Deep Neural Network by 12% on the TRECVID-MED database

研究动机与目标

  • 为解决在噪声大、多样性高且录制环境不受控的用户生成内容(UGC)视频中分类语义音频概念(如笑声、音乐、引擎声)的挑战。
  • 探索深度学习架构——特别是分层深度神经网络——在音频概念分类中的潜力,其中传统模型如GMMs性能有限。
  • 研究级联神经网络是否能有效建模音频流中的短期声学模式与长期时间调制。
  • 评估上下文窗口大小、降维(DCT)、预训练(RBM)以及分层处理对分类准确率的影响。
  • 证明H-DNN输出可作为更高层级多媒体检索任务中稳健的语义低级特征。

提出的方法

  • 系统采用两级分层架构:第一级多层感知机(MLP)处理MFCCs(14维)的49帧上下文窗口,随后第二级MLP分析由第一级网络输出生成的稀疏长期上下文窗口。
  • 输入特征为MFCCs(C0–C12)及其能量,按帧归一化,使用25ms汉明窗与10ms帧移构建49帧上下文窗口。
  • 在第一级网络前应用离散余弦变换(DCT)进行降维,以消除时间特征之间的相关性。
  • 第一级网络使用ReLU激活函数与Softmax输出层,生成后验概率;第二级网络处理这些后验概率以建模长期依赖关系。
  • 采用受限玻尔兹曼机(RBMs)进行预训练,以提升深层网络的训练稳定性和性能。
  • H-DNN通过反向传播端到端训练,性能在TRECVID-MED数据集上以帧级准确率(F.A.)进行评估。

实验结果

研究问题

  • RQ1分层深度神经网络是否能在用户生成视频的音频概念分类任务中超越传统GMMs和标准DNNs?
  • RQ2在真实世界、非受控的音频环境中,结合短期与长期上下文建模是否能提升音频概念分类的准确率?
  • RQ3架构选择(如层数、神经元数量、预训练、上下文窗口大小)如何影响该任务的性能?
  • RQ4H-DNN输出的后验概率能否作为更高层级多媒体事件检测的有效语义特征?
  • RQ5为何与H-DNN深度相同的普通DNN无法收敛?分层设计是否能缓解维度灾难问题?

主要发现

  • H-DNN在TRECVID-MED数据集上实现36.93%的帧级分类准确率,相较于GMM基线(24.07%)有54%的相对提升。
  • H-DNN相较于标准DNN实现12%的相对提升,最佳DNN准确率为32.96%。
  • 使用49帧上下文窗口与基于DCT的降维显著提升性能,当所有组件(上下文窗口、DCT、RBM预训练与分层处理)组合使用时,性能增益最大。
  • 仅在深层宽网络中,RBM预训练能提升性能,尤其在每层含2000个神经元的三层网络中效果最显著。
  • 与相同深度的单一深层网络相比,H-DNN架构更具鲁棒性,后者因维度灾难与局部极小值问题而无法收敛。
  • 系统在特定音频概念上表现优异:风声(63% vs. 51%)、语音(68% vs. 58%)、金属噪声(73% vs. 53%)和发动机声(6% vs. 3%),在各类音频事件中均表现出一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。