[论文解读] Utilizing Domain Knowledge in End-to-End Audio Processing
本文提出使用通过原始音频和目标梅尔频谱图监督学习得到的预训练梅尔频谱图变换,来初始化端到端卷积神经网络(CNN)的前几层,用于音频分类。该方法在性能上可与使用手工制作的梅尔频谱图训练的模型相媲美,证明了将领域知识有效嵌入深度网络中,可提升原始音频输入下的收敛速度与准确率。
End-to-end neural network based approaches to audio modelling are generally outperformed by models trained on high-level data representations. In this paper we present preliminary work that shows the feasibility of training the first layers of a deep convolutional neural network (CNN) model to learn the commonly-used log-scaled mel-spectrogram transformation. Secondly, we demonstrate that upon initializing the first layers of an end-to-end CNN classifier with the learned transformation, convergence and performance on the ESC-50 environmental sound classification dataset are similar to a CNN-based model trained on the highly pre-processed log-scaled mel-spectrogram features.
研究动机与目标
- 探究深度神经网络是否可通过使用配对的原始波形和梅尔频谱图进行监督训练,从原始音频中学习对数尺度梅尔频谱图变换。
- 评估使用学习到的变换初始化端到端音频分类器是否能提升原始波形输入下的收敛速度与性能。
- 确定此类学习到的初始化是否可达到使用高度预处理的梅尔频谱图特征训练的模型的性能水平。
- 探索在低数据量场景下,将领域知识与端到端学习相结合在音频建模中的可行性。
提出的方法
- 使用三层一维卷积神经网络(MSTmodel)以监督方式训练,将原始音频波形映射为对应的对数尺度梅尔频谱图。
- MSTmodel采用ReLU和tanh激活函数,使用SAME填充,其卷积核大小与步长设计与标准STFT参数一致,用于梅尔频谱计算。
- 将端到端音频分类器的前几层使用预训练的MSTmodel权重进行初始化,并在训练过程中保持冻结。
- 分类器采用改进的PiczakCNN架构,增加一维卷积层以处理原始输入,随后是最大池化、全连接层和Softmax输出。
- 训练采用带Nesterov动量的随机梯度下降,批量大小为500,初始峰值学习率为5e-3,训练200个周期,未使用L2正则化。
- 测试时推理采用对重叠梅尔频谱图输入段进行多数投票的方式。
实验结果
研究问题
- RQ1当使用配对的原始波形和梅尔频谱图进行训练时,深度神经网络能否从原始音频中学习到对数尺度梅尔频谱图变换?
- RQ2使用学习到的梅尔频谱图变换初始化端到端音频分类器是否能提升原始音频输入下的收敛速度与测试准确率?
- RQ3使用学习到的变换初始化的端到端模型与使用手工制作的梅尔频谱图特征训练的模型相比,性能如何?
- RQ4学习到的第一层特征是否可被解释为有意义的音频表示,如小波或带通滤波器?
- RQ5在初始训练后对已初始化的第一层参数进行微调,是否可能进一步提升性能?
主要发现
- MSTmodel成功学习到一种与标准对数尺度梅尔频谱图变换非常接近的表示,其学习到的滤波器与已知的音频滤波器组在视觉上高度相似,证明了其有效性。
- 当将预训练的MSTmodel权重用于初始化端到端分类器的前几层并保持冻结时,该模型在ESC-50数据集上通过多数投票方式实现了约53%的测试准确率。
- 该性能与使用梅尔频谱图(不含差分特征)训练的PiczakCNN基线模型准确率相当,表明学习到的初始化可使原始输入下的性能达到竞争力水平。
- MSTmodel第一层学习到的滤波器类似于小波和带通滤波器,表明网络发现了结构上有意义的音频表示。
- 研究表明,通过学习到的特征提取方式融入领域知识,可显著提升端到端音频分类性能,尤其在标签数据有限的场景下。
- 作者建议,在收敛后对第一层参数进行微调可能进一步提升性能,为未来研究开辟了有前景的方向。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。