Skip to main content
QUICK REVIEW

[论文解读] Acoustic scene classification using teacher-student learning with soft-labels

Hee-Soo Heo, Jee-weon Jung|arXiv (Cornell University)|Apr 23, 2019
Music and Audio Processing参考文献 18被引用 11
一句话总结

本文提出一种基于软标签蒸馏的师生学习框架,通过建模模糊场景类别之间的语义相似性,提升声学场景分类(ASC)性能。通过在多个音频片段上训练教师网络并蒸馏其隐层表征知识,学生网络学习到更丰富、更具泛化能力的表征,在DCASE 2018验证集上达到77.36%的准确率,显著优于单热标签基线方法。

ABSTRACT

Acoustic scene classification identifies an input segment into one of the pre-defined classes using spectral information. The spectral information of acoustic scenes may not be mutually exclusive due to common acoustic properties across different classes, such as babble noises included in both airports and shopping malls. However, conventional training procedure based on one-hot labels does not consider the similarities between different acoustic scenes. We exploit teacher-student learning with the purpose to derive soft-labels that consider common acoustic properties among different acoustic scenes. In teacher-student learning, the teacher network produces soft-labels, based on which the student network is trained. We investigate various methods to extract soft-labels that better represent similarities across different scenes. Such attempts include extracting soft-labels from multiple audio segments that are defined as an identical acoustic scene. Experimental results demonstrate the potential of our approach, showing a classification accuracy of 77.36 % on the DCASE 2018 task 1 validation set.

研究动机与目标

  • 为解决单热标签在捕捉机场与购物中心等模糊场景类别间共享声学特性方面的局限性。
  • 探索师生学习作为生成反映声学场景间语义相似性的软标签的方法。
  • 通过利用在扩展输入片段上训练的高性能教师网络的知识蒸馏,提升ASC性能。
  • 评估从不同网络层蒸馏知识的效果,特别是从最后一层隐藏层而非输出层蒸馏。

提出的方法

  • 教师网络在扩展的音频片段(10–20秒)上进行训练,以生成更能反映共性声学特性的泛化软标签。
  • 通过温度缩放的softmax函数生成软标签,温度值越高,分布越平滑、信息越丰富。
  • 通过知识蒸馏训练学生网络以匹配教师网络的输出概率,使用最小化KL散度的蒸馏损失。
  • 探索在输出层和最后一层隐藏层进行蒸馏,后者因具有更丰富的语义表征而表现更优。
  • 学生网络通过结合真实标签的交叉熵损失与教师网络的知识蒸馏损失进行微调。
  • 采用原始波形与频谱图双流模型的集成,对每种前端独立应用知识蒸馏。

实验结果

研究问题

  • RQ1能否通过教师网络的软标签蒸馏,建模模糊场景类别间的共享声学特性,从而提升声学场景分类准确率?
  • RQ2使用更长的输入片段训练教师网络是否能提升软标签质量并改善泛化能力?
  • RQ3从教师网络最后一层隐藏层蒸馏知识是否比从输出层更有效,以捕捉ASC中的类别间相似性?
  • RQ4软标签生成过程中温度超参数如何影响模型性能?
  • RQ5结合多段训练与隐藏层蒸馏等多种蒸馏技术是否能产生协同增益?

主要发现

  • 所提出的师生学习框架在DCASE 2018任务1验证集上达到77.36%的分类准确率,显著优于基线集成模型的74.42%。
  • 从教师网络最后一层隐藏层蒸馏知识获得74.26%的准确率,略高于输出层蒸馏(73.23%),因其能提供更丰富的语义表征。
  • 教师网络使用更长输入片段(20秒)时,T=5条件下性能提升至73.23%,而10秒输入片段仅达71.43%。
  • 多段训练与隐藏层蒸馏的结合显著降低了机场与购物中心等高度相似场景之间的混淆。
  • 消融实验证实,从最后一层隐藏层蒸馏比从输出层更有效,因其在高维嵌入空间中更好地捕捉了共性声学特性。
  • 混淆矩阵分析显示,采用软标签蒸馏后,最模糊场景对之间的误分类错误显著减少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。