Skip to main content
QUICK REVIEW

[论文解读] Continual Learning For On-Device Environmental Sound Classification

Xiao Yang, Xubo Liu|arXiv (Cornell University)|Jul 15, 2022
Music and Audio Processing被引用 5
一句话总结

本文提出 Uncertainty++,一种计算高效的基于回放的持续学习方法,用于设备端环境声音分类,通过在分类器的嵌入层上施加扰动来测量每个样本的分类不确定性,从而减轻灾难性遗忘。在 DCASE 2019 和 ESC-50 数据集上评估,Uncertainty++ 达到 58.1% 的准确率,相比基线不确定性方法将推理时间减少 90%以上,展示了在资源受限环境下的优越准确率与效率。

ABSTRACT

Continuously learning new classes without catastrophic forgetting is a challenging problem for on-device environmental sound classification given the restrictions on computation resources (e.g., model size, running memory). To address this issue, we propose a simple and efficient continual learning method. Our method selects the historical data for the training by measuring the per-sample classification uncertainty. Specifically, we measure the uncertainty by observing how the classification probability of data fluctuates against the parallel perturbations added to the classifier embedding. In this way, the computation cost can be significantly reduced compared with adding perturbation to the raw data. Experimental results on the DCASE 2019 Task 1 and ESC-50 dataset show that our proposed method outperforms baseline continual learning methods on classification accuracy and computational efficiency, indicating our method can efficiently and incrementally learn new classes without the catastrophic forgetting problem for on-device environmental sound classification.

研究动机与目标

  • 解决由于内存和计算资源有限,导致设备端环境声音分类中灾难性遗忘的挑战。
  • 开发一种高效的记忆更新算法(MUA),在不产生高计算成本的前提下,选择具有信息量的历史样本进行回放。
  • 在模型必须增量学习新声音类别而无需对所有历史数据重新训练的持续学习场景中,提升分类准确率和计算效率。
  • 设计一种与模型无关的方法,适用于对尺寸和内存有严格限制的移动和嵌入式平台。
  • 证明在嵌入层而非原始音频上进行基于不确定性的采样,可显著降低计算开销。

提出的方法

  • 提出 Uncertainty++,一种新颖的记忆更新算法(MUA),通过在分类器的嵌入层上施加扰动,而非原始音频输入,来测量每个样本的分类不确定性。
  • 在嵌入层上应用多种扰动类型——Audio Shift、Audio PitchShift 和 Audio Colored Noise,通过预测类别概率的波动来估计不确定性。
  • 基于不确定性得分选择历史样本进行回放,优先选择那些模糊或难以分类的样本,以保留对先前学习类别的知识。
  • 在增量学习过程中将选定的回放样本整合到训练流程中,从而在保持低计算开销的同时最小化灾难性遗忘。
  • 将不确定性估计形式化为嵌入上的可微过程,实现高效计算,对推理时间与内存使用的影响极小。
  • 实现一种轻量级、与模型无关的框架,兼容小型设备端模型(如 BC-ResNet-Mod,约 86k 参数),适用于实时部署。

实验结果

研究问题

  • RQ1在设备端环境声音分类中,基于分类器嵌入层的不确定性采样是否能有效减轻灾难性遗忘?
  • RQ2与原始音频特征相比,在嵌入层上应用不确定性估计的计算成本如何?
  • RQ3Uncertainty++ 在分类准确率和推理效率方面是否优于现有的 MUA 方法(如 Random、Reservoir、Prototype 和 Uncertainty)?
  • RQ4扰动类型数量的变化对不确定性估计过程的性能和计算成本有何影响?
  • RQ5所提出的方法是否能在资源受限的设备端持续学习场景中,保持高准确率的同时显著减少训练时间和内存使用?

主要发现

  • Uncertainty++ 在 ESC-50 数据集上达到 58.1% 的分类准确率,优于最佳基线方法(Uncertainty)及所有其他 MUA 方法。
  • 即使使用六种扰动类型,每次任务的平均训练时间也控制在 60 秒以内,相比 Uncertainty 基线方法减少 90%以上。
  • 仅使用两种扰动方法,Uncertainty++ 的性能已超过 Uncertainty 方法,表明其具有出色的样本效率。
  • Uncertainty++ 的 BWT(反向迁移)得分显著低于基线方法,证实其有效减轻了灾难性遗忘。
  • 不确定性估计的平均推理时间相比 Uncertainty 方法减少 90%以上,使其非常适用于设备端部署。
  • 该方法在不同数据集上均表现出鲁棒性,在 DCASE 2019 Task 1 和 ESC-50 上均取得一致的性能提升,验证了其在多样化环境声音分类任务中的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。