[论文解读] Learning Environmental Sounds with Multi-scale Convolutional Neural Network
该论文提出WaveMsNet,一种多尺度卷积神经网络,通过在多个时间尺度上学习滤波器来增强基于原始波形的音频表征,提升频率分辨率并实现更具区分性的特征提取。此外,该方法提出一种两阶段特征融合机制,将原始波形与对数梅尔倒谱图特征无缝结合于单一端到端模型中,在ESC-10上实现93.75%的最先进准确率,在ESC-50上实现79.10%的最先进准确率。
Deep learning has dramatically improved the performance of sounds recognition. However, learning acoustic models directly from the raw waveform is still challenging. Current waveform-based models generally use time-domain convolutional layers to extract features. The features extracted by single size filters are insufficient for building discriminative representation of audios. In this paper, we propose multi-scale convolution operation, which can get better audio representation by improving the frequency resolution and learning filters cross all frequency area. For leveraging the waveform-based features and spectrogram-based features in a single model, we introduce two-phase method to fuse the different features. Finally, we propose a novel end-to-end network called WaveMsNet based on the multi-scale convolution operation and two-phase method. On the environmental sounds classification datasets ESC-10 and ESC-50, the classification accuracies of our WaveMsNet achieve 93.75% and 79.10% respectively, which improve significantly from the previous methods.
研究动机与目标
- 解决单尺度滤波器在从原始波形中捕捉区分性音频特征时的局限性,此类方法在频率分辨率与高频覆盖之间存在权衡。
- 克服先前方法中波形与倒谱图特征融合不佳的问题,这些方法依赖于分别训练模型后对输出进行平均,而非联合学习。
- 构建一个统一的深度学习框架,以端到端方式学习原始波形与对数梅尔倒谱图之间的互补表征。
- 通过引入多尺度时间卷积和自适应特征融合,提升环境声音分类性能,超越现有仅使用波形的模型。
提出的方法
- 提出一种多尺度卷积操作,使用不同大小和步长的滤波器,从原始波形中提取多个时间尺度的特征,提升整个频谱范围内的频率分辨率与覆盖范围。
- 设计一种两阶段训练策略:首先仅在原始波形上预训练网络,然后在冻结早期层以保留波形特异性表征的前提下,使用融合输入(多尺度特征 + 对数梅尔特征)进行微调。
- 实现一种特征融合机制,在网络的后期阶段将多尺度波形特征与对数梅尔倒谱图特征进行拼接,实现互补表征的联合优化。
- 构建WaveMsNet,一种集成多尺度卷积与两阶段融合方法的端到端CNN架构,共享后端分类层。
- 采用两阶段训练协议:第一阶段仅在原始波形上训练网络,以学习具有区分性的时域模式;第二阶段引入对数梅尔特征,并仅微调网络后层。
- 在每个卷积层后应用批量归一化和ReLU激活函数,并使用全局平均池化后接全连接层进行分类。
实验结果
研究问题
- RQ1与单尺度滤波器相比,对原始波形应用多尺度卷积操作是否能提升音频表征学习能力?
- RQ2在单一模型中通过两阶段训练实现波形与对数梅尔特征融合,是否比分别训练模型后平均预测结果表现更优?
- RQ3多尺度卷积层中不同尺度的滤波器如何分别贡献于学习特定频带的特征?
- RQ4与最先进的仅使用波形的模型相比,所提出的融合策略在环境声音数据集上的分类准确率提升程度如何?
- RQ5性能增益是源于更优的特征表征还是更优的融合策略?冻结早期层对最终准确率有何影响?
主要发现
- WaveMsNet在ESC-10数据集上达到93.75%的准确率,在ESC-50上达到79.10%,显著优于以往仅使用波形的模型,且接近人类水平表现(95.70%和81.30%)。
- 在使用相同滤波器数量的前提下,多尺度卷积操作相比单尺度模型将分类准确率提升了约3%,证明其在捕捉多样化谱时域模式方面的有效性。
- 与仅使用第一阶段的模型相比,采用特征融合的两阶段训练方法在ESC-10上提升5.70%,在ESC-50上提升9.05%,表明波形与倒谱图特征的联合优化极为有效。
- 在第二阶段冻结早期层(Conv1和Conv2)可带来更大的性能增益,而非更新它们,表明若未谨慎处理,对数梅尔特征可能破坏原始波形表征的学习。
- 与单阶段联合训练相比,两阶段方法在ESC-10上提升5.00%,在ESC-50上提升2.75%,证实分阶段预训练与微调能实现更优的特征学习与模型稳定性。
- 对学习滤波器的可视化显示,不同尺度在不同频带中表现出专业化特征:较小尺度捕捉更宽、与梅尔尺度对齐的频带,而较大尺度则聚焦于低频带的高频分辨率,证实多尺度学习具有互补性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。