Skip to main content
QUICK REVIEW

[论文解读] Sound Context Classification Basing on Join Learning Model and Multi-Spectrogram Features

Dat Ngo, Hao Hoang|arXiv (Cornell University)|May 26, 2020
Music and Audio Processing参考文献 53被引用 9
一句话总结

本文提出了一种用于声学场景分类(ASC)的深度学习框架,采用多谱图特征和一种新颖的联合学习架构,结合并行的卷积神经网络与循环神经网络。该方法在LITIS Rouen数据集上实现了99.1%的准确率,在DCASE 2016–2018基准测试中排名前列,展现出在多种数据集和录音条件下的鲁棒性。

ABSTRACT

In this paper, we present a deep learning framework applied for Acoustic Scene Classification (ASC), the task of classifying scene contexts from environmental input sounds. An ASC system generally comprises of two main steps, referred to as front-end feature extraction and back-end classification. In the first step, an extractor is used to extract low-level features from raw audio signals. Next, the discriminative features extracted are fed into and classified by a classifier, reporting accuracy results. Aim to develop a robust framework applied for ASC, we address exited issues of both the front-end and back-end components in an ASC system, thus present three main contributions: Firstly, we carry out a comprehensive analysis of spectrogram representation extracted from sound scene input, thus propose the best multi-spectrogram combinations. In terms of back-end classification, we propose a novel join learning architecture using parallel convolutional recurrent networks, which is effective to learn spatial features and temporal sequences of spectrogram input. Finally, good experimental results obtained over benchmark datasets of IEEE AASP Challenge on Detection and Classification of Acoustic Scenes and Events (DCASE) 2016 Task 1, 2017 Task 1, 2018 Task 1A & 1B, LITIS Rouen prove our proposed framework general and robust for ASC task.

研究动机与目标

  • 为解决声学场景分类(ASC)中环境声音的可变性、频率带重叠以及信噪比低等挑战。
  • 通过系统分析和组合多种谱图类型(如对数梅尔谱、CQT、GAM、STFT),提升特征表示能力,增强判别性能。
  • 开发一种鲁棒的后端分类器,能够捕捉音频场景中的空间特征(谱图纹理)与时间特征(序列动态)。
  • 在标准化基准(DCASE 2016–2018、LITIS Rouen)上评估该框架,以验证其在不同数据集和录音条件下的泛化能力与鲁棒性。

提出的方法

  • 采用多谱图输入策略,结合对数梅尔谱、CQT、伽马音调(GAM)和STFT谱图,以丰富低层次音频表征。
  • 设计一种具有并行分支的联合学习架构:一个分支使用1D-CNN进行空间特征提取,另一个分支使用双向LSTM网络进行时间序列建模。
  • 通过晚期融合(逐元素拼接)将并行分支的输出进行融合,再通过全连接层进行最终分类。
  • 使用交叉熵损失与Adam优化器进行端到端训练,结合数据增强和Dropout进行正则化。
  • 采用晚期融合策略,整合多种谱图组合的预测结果,提升对输入变化的鲁棒性。
  • 应用标准预处理流程:将音频分割为1秒片段,进行归一化处理,并使用汉宁窗与10ms帧移计算梅尔尺度谱图。

实验结果

研究问题

  • RQ1哪种谱图类型组合(对数梅尔谱、CQT、GAM、STFT)能为ASC生成最具判别性的特征?
  • RQ2结合CNN与RNN的联合学习架构是否能有效建模谱图中的空间与时间模式,从而提升ASC性能?
  • RQ3所提出的多谱图与联合学习框架在不同数据集和录音条件(如设备不匹配)下是否具备良好的泛化能力?
  • RQ4与单特征基线相比,多谱图输入的晚期融合策略是否能提升鲁棒性与准确率?
  • RQ5在DCASE 2016–2018与LITIS Rouen等标准化ASC基准测试中,该系统与最先进模型相比表现如何?

主要发现

  • 对数梅尔谱、CQT与伽马音调谱图的组合取得了最高性能,在LITIS Rouen数据集上达到99.1%的准确率。
  • 在DCASE 2016任务1中,系统准确率达到89.2%,在所有参赛者中排名第二,位列最先进系统前三名。
  • 在DCASE 2018任务1A中,模型准确率达到77.8%,排名前四,优于该数据集上所有已发表的最先进系统。
  • 在DCASE 2018任务1B中,系统准确率达到67.5%,展现出对设备不匹配的强鲁棒性,且与顶尖表现系统相比仍具高度竞争力。
  • 消融实验证实,采用并行CNN与双向LSTM分支的联合学习架构显著提升了特征学习能力,优于单分支模型。
  • 多谱图输入策略始终优于单谱图基线,验证了互补的频率与时间表征的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。