Skip to main content
QUICK REVIEW

[论文解读] Low-Complexity Models for Acoustic Scene Classification Based on Receptive Field Regularization and Frequency Damping

Khaled Koutini, Florian Henkel|arXiv (Cornell University)|Nov 5, 2020
Music and Audio Processing参考文献 21被引用 8
一句话总结

本文提出一种频率阻尼技术,用于在低复杂度卷积神经网络中正则化感受野,以提升声学场景分类任务的泛化能力,且无需改变网络结构。该方法在不增加参数量的前提下实现了最先进性能,在DCASE-2020低复杂度声学场景分类挑战赛中获得第一名,显著提升了剪枝、分解和通道宽度缩减设置下的模型准确率。

ABSTRACT

Deep Neural Networks are known to be very demanding in terms of computing and memory requirements. Due to the ever increasing use of embedded systems and mobile devices with a limited resource budget, designing low-complexity models without sacrificing too much of their predictive performance gained great importance. In this work, we investigate and compare several well-known methods to reduce the number of parameters in neural networks. We further put these into the context of a recent study on the effect of the Receptive Field (RF) on a model's performance, and empirically show that we can achieve high-performing low-complexity models by applying specific restrictions on the RFs, in combination with parameter reduction methods. Additionally, we propose a filter-damping technique for regularizing the RF of models, without altering their architecture and changing their parameter counts. We will show that incorporating this technique improves the performance in various low-complexity settings such as pruning and decomposed convolution. Using our proposed filter damping, we achieved the 1st rank at the DCASE-2020 Challenge in the task of Low-Complexity Acoustic Scene Classification.

研究动机与目标

  • 研究低复杂度CNN中感受野大小、模型复杂度与泛化能力之间的相互作用,用于声学场景分类任务。
  • 在受控感受野条件下,评估参数压缩技术(剪枝、分解和通道宽度缩减)的有效性。
  • 开发一种轻量化、与网络结构无关的感受野正则化方法,以提升低复杂度模型的泛化能力。
  • 在不增加模型参数量的前提下,实现低复杂度声学场景分类的最先进性能。

提出的方法

  • 提出一种滤波器阻尼技术,通过修改滤波器权重来正则化任意CNN的有效感受野,而无需改变网络结构或参数数量。
  • 在基于ResNet的模型中应用阻尼,使用超参数ρ控制感受野大小,从而系统研究感受野对性能的影响。
  • 采用标准的低复杂度技术:权重剪枝、通道分解(压缩因子Z=4),以及将通道数缩减至64或32个基础通道。
  • 使用阻尼基线模型(Damp)作为参考,对比剪枝、分解和通道宽度缩减变体的性能表现。
  • 采用迭代剪枝结合微调和权重重置策略,并在所有层中统一应用阻尼,以稳定训练过程并提升泛化能力。
  • 在DCASE’18和DCASE’20数据集上评估模型,使用准确率和非零参数数量作为评价指标。

实验结果

研究问题

  • RQ1感受野大小如何影响低复杂度CNN在声学场景分类任务中的性能?
  • RQ2在感受野正则化条件下,剪枝、分解和通道宽度缩减三种参数压缩方法中,哪一种在准确率与复杂度之间取得最佳平衡?
  • RQ3一种非侵入式、与网络结构无关的技术是否能在不增加参数量的前提下提升低复杂度模型的泛化能力?
  • RQ4频率阻尼是否能增强低复杂度设置下对感受野大小变化的鲁棒性?

主要发现

  • 频率阻尼在所有低复杂度设置下均提升了准确率:在DCASE’20数据集上,阻尼后的ResNet模型达到97.45%的准确率,非零参数量为106万,优于非阻尼基线模型。
  • 剪枝在各类复杂度压缩方法中表现最佳,仅使用25万非零参数即保持97.45%的准确率。
  • 分解卷积导致显著性能下降(准确率为97.00%),表明在低复杂度设置下鲁棒性较差。
  • 在DCASE’20数据集上,将通道数缩减至64个基础通道并结合阻尼后,准确率达到97.22%,但进一步缩减至32个通道导致性能明显下降。
  • 在DCASE’18数据集上,使用ρ=7的阻尼ResNet模型达到79.15%的准确率,较非阻尼基线模型提升0.63个百分点。
  • 所提出的阻尼技术使模型在DCASE-2020低复杂度声学场景分类挑战赛中获得第一名。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。