[论文解读] Classifying Variable-Length Audio Files with All-Convolutional Networks and Masked Global Pooling
本文提出一种全卷积神经网络,结合掩码全局池化层,用于在声学场景分类和家庭音频标记任务中对可变长度音频文件进行分类。该网络处理原始STFT特征,无需全连接层或Dropout,实现了84.5%的准确率(对比基线72.5%)和0.17的等错误率(对比基线0.21),通过端到端特征学习和针对可变长度输入的自适应池化,展现出优越性能。
We trained a deep all-convolutional neural network with masked global pooling to perform single-label classification for acoustic scene classification and multi-label classification for domestic audio tagging in the DCASE-2016 contest. Our network achieved an average accuracy of 84.5% on the four-fold cross-validation for acoustic scene recognition, compared to the provided baseline of 72.5%, and an average equal error rate of 0.17 for domestic audio tagging, compared to the baseline of 0.21. The network therefore improves the baselines by a relative amount of 17% and 19%, respectively. The network only consists of convolutional layers to extract features from the short-time Fourier transform and one global pooling layer to combine those features. It particularly possesses neither fully-connected layers, besides the fully-connected output layer, nor dropout layers.
研究动机与目标
- 解决在声学场景分类和家庭音频标记任务中对可变长度音频文件进行分类的挑战。
- 通过在STFT表示上进行端到端深度学习,超越基于手工设计特征的基线系统。
- 消除全连接层和Dropout,仅依赖卷积层和全局池化实现正则化与效率。
- 开发一种鲁棒且参数高效的架构,在无需输入截断或零填充的情况下,泛化于多种音频时长。
提出的方法
- 网络以短时傅里叶变换(STFT)的幅度作为输入,使用25 ms的汉汉窗和15 ms的步长。
- 采用一维卷积层堆叠结构,卷积核大小为3,步长为2,以降低时间维,替代传统池化层。
- 掩码全局平均池化层在时间维度上聚合特征,通过忽略填充区域,动态适应输入长度。
- 每个卷积层后使用ReLU激活函数,避免全连接层,从而减少参数量和训练时间。
- 对整个数据集应用特征标准化,将输入特征归一化为零均值和单位方差。
- 网络在原始STFT输入上进行端到端训练,不使用MFCC等手工特征,专注于学习滤波器组。
实验结果
研究问题
- RQ1全卷积网络结合掩码全局池化是否能在可变长度音频的声学场景分类任务中超越传统基线?
- RQ2掩码全局池化在无需输入截断或零填充的情况下,处理可变长度音频输入的效率如何?
- RQ3在音频分类任务中,移除全连接层和Dropout后,模型是否仍能保持良好泛化能力?
- RQ4与下采样至16 kHz相比,保留完整的44.1 kHz采样率在性能提升方面有多大贡献?
- RQ5在STFT特征上进行端到端学习是否能超越基于手工特征(如MFCC)的系统?
主要发现
- 在声学场景分类的四折交叉验证中,网络平均准确率达到84.5%,相比72.5%的基线提升了12个百分点。
- 在家庭音频标记任务中,网络实现了0.17的等错误率(EER),相比基线的0.21相对提升了19%。
- 除“咖啡馆/餐厅”和“住宅区”两个声学场景外,该模型在其余所有场景上均优于基线。
- 网络最难以识别的场景是“公园”,识别率为13.9%,与基线性能持平。
- 网络在识别“办公室”和“地铁站”场景方面表现出色,部分折次达到100%准确率。
- 儿童语音是最容易识别的音频标签(EER 0.06),而成人男性语音最难识别(EER 0.20);尽管基线在宽带噪声和游戏/电视标签上表现良好,网络仍在此类标签上表现吃力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。