[论文解读] Investigating Multi-Feature Selection and Ensembling for Audio Classification
本文通过在三个语音数字数据集上结合卷积神经网络(CNN)、EfficientNet、MobileNet等深度学习模型,研究了多特征集成在音频分类中的应用,整合了梅尔频谱图(Mel Spectrogram)、梅尔频率倒谱系数(MFCC)和过零率(ZCR)。结果表明,仅集成高性能个体特征——主要是梅尔频谱图和MFCC——可实现更高的准确率和效率,优于单一特征及全部特征的集成。
Deep Learning (DL) algorithms have shown impressive performance in diverse domains. Among them, audio has attracted many researchers over the last couple of decades due to some interesting patterns--particularly in classification of audio data. For better performance of audio classification, feature selection and combination play a key role as they have the potential to make or break the performance of any DL model. To investigate this role, we conduct an extensive evaluation of the performance of several cutting-edge DL models (i.e., Convolutional Neural Network, EfficientNet, MobileNet, Supper Vector Machine and Multi-Perceptron) with various state-of-the-art audio features (i.e., Mel Spectrogram, Mel Frequency Cepstral Coefficients, and Zero Crossing Rate) either independently or as a combination (i.e., through ensembling) on three different datasets (i.e., Free Spoken Digits Dataset, Audio Urdu Digits Dataset, and Audio Gujarati Digits Dataset). Overall, results suggest feature selection depends on both the dataset and the model. However, feature combinations should be restricted to the only features that already achieve good performances when used individually (i.e., mostly Mel Spectrogram, Mel Frequency Cepstral Coefficients). Such feature combination/ensembling enabled us to outperform the previous state-of-the-art results irrespective of our choice of DL model.
研究动机与目标
- 研究不同音频特征组合对深度学习模型在音频分类中性能的影响。
- 评估在多种深度学习架构中集成多个音频特征(梅尔频谱图、MFCC、ZCR)的有效性。
- 确定特征集成是否相比单一特征能提升分类准确率和推理效率。
- 识别在不同数据集和模型间具有良好泛化能力的最优特征组合,尤其针对语音数字分类任务。
- 发布代码和训练好的模型,以支持未来在音频特征集成和音频深度学习研究方面的工作。
提出的方法
- 从原始音频信号中提取三种最先进的音频特征:梅尔频谱图(MS)、梅尔频率倒谱系数(MFCC)和过零率(ZCR)。
- 在每个特征上分别训练并评估三种深度学习模型:卷积神经网络(CNN)、EfficientNetB0 和 MobileNetV1。
- 通过将多个特征的特征图(如 MS + MFCC,MS + MFCC + ZCR)拼接后作为相同模型的输入,实现特征集成。
- 在三个基准数据集上使用标准训练和验证协议:自由语音数字数据集(FSD)、乌尔都语数字音频数据集(AUDD)和古吉拉特语数字音频数据集(AGDD)。
- 通过准确率(均值 ± 标准差)和推理时间(ms)来衡量性能,以评估模型的有效性与效率。
- 对所有特征组合与模型进行消融研究,以识别最优配置,并通过验证准确率随训练轮次变化的曲线图进行可视化。
实验结果
研究问题
- RQ1在不同深度学习模型和数据集中,哪些个体音频特征(MS、MFCC、ZCR)能获得最高的分类准确率?
- RQ2集成多个音频特征是否能持续提升模型性能,还是可能导致性能下降?
- RQ3是否存在在不同模型和数据集中均具有良好泛化能力的特定特征组合?
- RQ4特征集成如何影响推理时间和模型效率?
- RQ5系统性地进行特征选择与集成,是否能超越当前最先进的语音数字分类结果?
主要发现
- 梅尔频谱图(MS)和梅尔频率倒谱系数(MFCC)在所有模型和数据集中单独使用时均取得了最高准确率,且MS始终优于或与MFCC持平。
- 过零率(ZCR)在所有模型中均显著降低性能,例如在古吉拉特语数据集上,EfficientNetB0的准确率最低降至0.321。
- 集成全部三个特征(MS、MFCC、ZCR)的表现始终劣于仅集成MS和MFCC的组合,表明引入低性能特征会损害整体性能。
- 表现最佳的配置为集成MS和MFCC,在使用MobileNetV1时于自由语音数字数据集上实现了0.987 ± 0.05的准确率,优于先前的最先进结果。
- 使用MS和MFCC组合的MobileNetV1在0.63 ms的推理时间内实现了0.987 ± 0.05的准确率,展现出极高的效率。
- 验证曲线显示,MS和MFCC的训练动态稳定,而ZCR导致训练不稳定,尤其在更大的模型(如EfficientNet)中更为明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。