Skip to main content
QUICK REVIEW

[论文解读] Domain Generalization on Efficient Acoustic Scene Classification using Residual Normalization

Byeonggeun Kim, Seunghan Yang|arXiv (Cornell University)|Nov 12, 2021
Music and Audio Processing参考文献 22被引用 7
一句话总结

本文提出残差归一化(Residual Normalization, ResNorm),一种基于频率的归一化技术,结合残差连接以抑制设备特异性音频差异,同时保留类别判别特征,实现在高效声学场景分类中的域泛化。该方法在 TAU Urban Acoustic Scenes 2020 Mobile 数据集上取得 76.3% 的测试准确率(参数量为 315k),压缩至 61.0KB 后准确率为 75.3%,在 DCASE 2021 挑战赛 Task1A 中获得第一名。

ABSTRACT

It is a practical research topic how to deal with multi-device audio inputs by a single acoustic scene classification system with efficient design. In this work, we propose Residual Normalization, a novel feature normalization method that uses frequency-wise normalization % instance normalization with a shortcut path to discard unnecessary device-specific information without losing useful information for classification. Moreover, we introduce an efficient architecture, BC-ResNet-ASC, a modified version of the baseline architecture with a limited receptive field. BC-ResNet-ASC outperforms the baseline architecture even though it contains the small number of parameters. Through three model compression schemes: pruning, quantization, and knowledge distillation, we can reduce model complexity further while mitigating the performance degradation. The proposed system achieves an average test accuracy of 76.3% in TAU Urban Acoustic Scenes 2020 Mobile, development dataset with 315k parameters, and average test accuracy of 75.3% after compression to 61.0KB of non-zero parameters. The proposed method won the 1st place in DCASE 2021 challenge, TASK1A.

研究动机与目标

  • 解决在数据不平衡且模型复杂度受限条件下,跨多种音频设备进行声学场景分类的挑战。
  • 开发一种高效神经网络架构,在最小化参数量的同时保持高准确率。
  • 通过减少设备特异性特征偏差来提升对未见设备的域泛化能力,同时不损失判别性信息。
  • 通过剪枝、量化和知识蒸馏实现模型压缩,同时将性能下降最小化。
  • 设计一种新型归一化方法,提升低复杂度模型对设备差异的鲁棒性。

提出的方法

  • 提出 BC-ResNet-ASC,一种改进的广播残差网络,采用有限感受野和最大池化替代空洞卷积,以减小模型尺寸。
  • 提出残差归一化(ResNorm),一种基于频率带的归一化方法,对每个频率带使用实例归一化,并引入可学习的残差路径以保留有用特征。
  • 采用混合归一化策略,输出为频率带归一化特征与原始残差输入的加权和,由超参数 λ 控制。
  • 使用知识蒸馏技术,将大教师模型的知识迁移至压缩后的学生模型,以缓解压缩过程中的准确率损失。
  • 应用结构化剪枝(剪枝率 89%)和混合精度量化(卷积层使用 8 位,归一化层使用 16 位),将模型大小压缩至 61.0KB。

实验结果

研究问题

  • RQ1轻量级神经网络架构是否能在保持对设备特异性差异鲁棒性的同时,实现高准确率的声学场景分类?
  • RQ2与标准归一化或特征变换相比,基于残差连接路径的频率域归一化(ResNorm)在提升对未见设备泛化能力方面的有效性如何?
  • RQ3剪枝、量化和知识蒸馏等模型压缩技术在低复杂度声学场景分类中,能在多大程度上减小模型尺寸而不造成显著性能下降?
  • RQ4所提出的 ResNorm 模块是否能在包括已见和未见设备在内的各类设备上提升性能,尤其在域不平衡条件下?
  • RQ5ResNorm 中的超参数 λ 是否可固定为 0.1,以在不同模型尺寸下实现正则化与特征保留的平衡?

主要发现

  • 采用残差归一化的 BC-ResNet-ASC-1 模型取得 65.8% 的测试准确率,较基线提升 6%,尤其显著提升了对未见设备的性能。
  • 残差归一化有效缩小了已见与未见设备之间的准确率差距,与仅使用频带实例归一化(FreqIN)相比,小模型在设备 A 上分别提升 3.0% 和 8.2%。
  • 完整模型(BC-ResNet-ASC-8 + ResNorm)在 TAU Urban Acoustic Scenes 2020 Mobile 开发集上取得 76.3% 的测试准确率,参数量仅为 315k。
  • 经 89% 剪枝、8 位量化和知识蒸馏压缩后,模型仅需 61.0KB 的非零参数,测试准确率仍达 75.3%。
  • 消融实验表明,从网络中移除 ResNorm 模块后,小模型性能提升至 67.1%,但大模型性能下降 1%,表明需对 λ 进行自适应调优。
  • 无残差连接的消融实验(等价于 FreqIN)在设备 A 上准确率显著更低(小模型中较 ResNorm 低 8.2%),证实了恒等跳跃连接的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。