[论文解读] Domain Generalization on Efficient Acoustic Scene Classification using Residual Normalization
本文提出残差归一化(Residual Normalization, ResNorm),一种基于频率的归一化技术,结合残差连接以抑制设备特异性音频差异,同时保留类别判别特征,实现在高效声学场景分类中的域泛化。该方法在 TAU Urban Acoustic Scenes 2020 Mobile 数据集上取得 76.3% 的测试准确率(参数量为 315k),压缩至 61.0KB 后准确率为 75.3%,在 DCASE 2021 挑战赛 Task1A 中获得第一名。
It is a practical research topic how to deal with multi-device audio inputs by a single acoustic scene classification system with efficient design. In this work, we propose Residual Normalization, a novel feature normalization method that uses frequency-wise normalization % instance normalization with a shortcut path to discard unnecessary device-specific information without losing useful information for classification. Moreover, we introduce an efficient architecture, BC-ResNet-ASC, a modified version of the baseline architecture with a limited receptive field. BC-ResNet-ASC outperforms the baseline architecture even though it contains the small number of parameters. Through three model compression schemes: pruning, quantization, and knowledge distillation, we can reduce model complexity further while mitigating the performance degradation. The proposed system achieves an average test accuracy of 76.3% in TAU Urban Acoustic Scenes 2020 Mobile, development dataset with 315k parameters, and average test accuracy of 75.3% after compression to 61.0KB of non-zero parameters. The proposed method won the 1st place in DCASE 2021 challenge, TASK1A.
研究动机与目标
- 解决在数据不平衡且模型复杂度受限条件下,跨多种音频设备进行声学场景分类的挑战。
- 开发一种高效神经网络架构,在最小化参数量的同时保持高准确率。
- 通过减少设备特异性特征偏差来提升对未见设备的域泛化能力,同时不损失判别性信息。
- 通过剪枝、量化和知识蒸馏实现模型压缩,同时将性能下降最小化。
- 设计一种新型归一化方法,提升低复杂度模型对设备差异的鲁棒性。
提出的方法
- 提出 BC-ResNet-ASC,一种改进的广播残差网络,采用有限感受野和最大池化替代空洞卷积,以减小模型尺寸。
- 提出残差归一化(ResNorm),一种基于频率带的归一化方法,对每个频率带使用实例归一化,并引入可学习的残差路径以保留有用特征。
- 采用混合归一化策略,输出为频率带归一化特征与原始残差输入的加权和,由超参数 λ 控制。
- 使用知识蒸馏技术,将大教师模型的知识迁移至压缩后的学生模型,以缓解压缩过程中的准确率损失。
- 应用结构化剪枝(剪枝率 89%)和混合精度量化(卷积层使用 8 位,归一化层使用 16 位),将模型大小压缩至 61.0KB。
实验结果
研究问题
- RQ1轻量级神经网络架构是否能在保持对设备特异性差异鲁棒性的同时,实现高准确率的声学场景分类?
- RQ2与标准归一化或特征变换相比,基于残差连接路径的频率域归一化(ResNorm)在提升对未见设备泛化能力方面的有效性如何?
- RQ3剪枝、量化和知识蒸馏等模型压缩技术在低复杂度声学场景分类中,能在多大程度上减小模型尺寸而不造成显著性能下降?
- RQ4所提出的 ResNorm 模块是否能在包括已见和未见设备在内的各类设备上提升性能,尤其在域不平衡条件下?
- RQ5ResNorm 中的超参数 λ 是否可固定为 0.1,以在不同模型尺寸下实现正则化与特征保留的平衡?
主要发现
- 采用残差归一化的 BC-ResNet-ASC-1 模型取得 65.8% 的测试准确率,较基线提升 6%,尤其显著提升了对未见设备的性能。
- 残差归一化有效缩小了已见与未见设备之间的准确率差距,与仅使用频带实例归一化(FreqIN)相比,小模型在设备 A 上分别提升 3.0% 和 8.2%。
- 完整模型(BC-ResNet-ASC-8 + ResNorm)在 TAU Urban Acoustic Scenes 2020 Mobile 开发集上取得 76.3% 的测试准确率,参数量仅为 315k。
- 经 89% 剪枝、8 位量化和知识蒸馏压缩后,模型仅需 61.0KB 的非零参数,测试准确率仍达 75.3%。
- 消融实验表明,从网络中移除 ResNorm 模块后,小模型性能提升至 67.1%,但大模型性能下降 1%,表明需对 λ 进行自适应调优。
- 无残差连接的消融实验(等价于 FreqIN)在设备 A 上准确率显著更低(小模型中较 ResNorm 低 8.2%),证实了恒等跳跃连接的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。