[论文解读] A Lottery Ticket Hypothesis Framework for Low-Complexity Device-Robust Neural Acoustic Scene Classification
该论文提出Acoustic Lottery,一种新颖的框架,结合知识蒸馏、基于彩票假说的剪枝、数据增强和量化技术,以压缩神经声学场景分类器,实现低复杂度、多设备鲁棒性。该方法在模型压缩至128 KB以下的同时,实现了79.4%的验证准确率和0.64的对数损失,证明了过参数化的模型可被剪枝为高性能、紧凑的系统,适用于边缘设备部署。
We propose a novel neural model compression strategy combining data augmentation, knowledge transfer, pruning, and quantization for device-robust acoustic scene classification (ASC). Specifically, we tackle the ASC task in a low-resource environment leveraging a recently proposed advanced neural network pruning mechanism, namely Lottery Ticket Hypothesis (LTH), to find a sub-network neural model associated with a small amount non-zero model parameters. The effectiveness of LTH for low-complexity acoustic modeling is assessed by investigating various data augmentation and compression schemes, and we report an efficient joint framework for low-complexity multi-device ASC, called \emph{Acoustic Lottery}. Acoustic Lottery could compress an ASC model up to $1/10^{4}$ and attain a superior performance (validation accuracy of 79.4% and Log loss of 0.64) compared to its not compressed seed model. All results reported in this work are based on a joint effort of four groups, namely GT-USTC-UKE-Tencent, aiming to address the "Low-Complexity Acoustic Scene Classification (ASC) with Multiple Devices" in the DCASE 2021 Challenge Task 1a.
研究动机与目标
- 为解决开发适用于边缘设备的低复杂度、设备鲁棒性声学场景分类(ASC)模型的挑战。
- 探究过参数化的ASC模型是否可被压缩为小型高性能子网络,同时不损失泛化能力。
- 设计一个集成数据增强、知识蒸馏、结构化剪枝和量化技术的联合框架,以实现高效部署。
- 满足DCASE 2021挑战任务1a对模型大小低于128 KB的要求,同时在多种录音设备上保持高性能。
提出的方法
- 采用教师-学生学习(知识蒸馏)框架,将大型预训练两阶段FCNN教师模型的知识迁移至更小的学生模型。
- 应用彩票假说(LTH)从学生模型中识别并微调稀疏剪枝子网络,初始化时使用与原始网络相同的随机权重。
- 采用Mixup、频谱增强、音高偏移、速度变化和噪声注入等数据增强技术,提升模型在多样化设备上的泛化能力。
- 采用两阶段融合技术,通过整合多个模型头的输出,提升预测性能。
- 剪枝后,将模型从float32量化至float8,进一步减小模型尺寸,实现4倍压缩率。
- 最终框架Acoustic Lottery将所有组件整合为单一流水线,最终模型的非零参数量小于128 KB。
实验结果
研究问题
- RQ1过参数化的、设备鲁棒的ASC模型能否在不损失性能的前提下实现显著压缩?
- RQ2彩票假说是否能有效用于神经声学模型的剪枝,以实现低复杂度部署?
- RQ3知识蒸馏与数据增强如何协同提升低复杂度ASC的鲁棒性与性能?
- RQ4量化能否与剪枝和蒸馏有效结合,实现无性能退化的超紧凑模型?
主要发现
- Acoustic Lottery框架实现了79.4%的验证准确率和0.64的对数损失,优于未剪枝的学生模型基线。
- LTH剪枝使SIC架构的模型尺寸缩小约149倍,从503KB降至0.9KB,同时准确率从67.8%提升至79.4%。
- 知识蒸馏与LTH剪枝的结合实现了149倍的压缩率,且性能优于基线,证实原始模型显著过参数化。
- 从float32量化至float8实现了4倍压缩率,但性能有所下降;然而,集成四个量化模型的表现优于未量化基线。
- 最终提交方案采用四个两阶段SIC与LIC模型的集成,使开发集上的性能达到最佳,准确率为79.4%,对数损失为0.64。
- LIC模型被压缩至687KB,最佳对数损失为0.925,参数减少20%(从60%降至20%)使准确率从67.64%提升至68.59%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。