[论文解读] Relational Teacher Student Learning with Neural Label Embedding for Device Adaptation in Acoustic Scene Classification
本文提出一种基于神经标签嵌入(NLE)的关系蒸馏教师-学生学习框架,以解决声学场景分类中的设备失配问题。通过NLE捕捉声学场景类别之间的结构关系,并在无需成对源-目标数据的情况下应用关系蒸馏,该方法在DCASE 2018 Task1b数据集上实现了显著的准确率提升——在Device C上最高达到64.2%,优于单热编码和传统软标签蒸馏技术。
In this paper, we propose a domain adaptation framework to address the device mismatch issue in acoustic scene classification leveraging upon neural label embedding (NLE) and relational teacher student learning (RTSL). Taking into account the structural relationships between acoustic scene classes, our proposed framework captures such relationships which are intrinsically device-independent. In the training stage, transferable knowledge is condensed in NLE from the source domain. Next in the adaptation stage, a novel RTSL strategy is adopted to learn adapted target models without using paired source-target data often required in conventional teacher student learning. The proposed framework is evaluated on the DCASE 2018 Task1b data set. Experimental results based on AlexNet-L deep classification models confirm the effectiveness of our proposed approach for mismatch situations. NLE-alone adaptation compares favourably with the conventional device adaptation and teacher student based adaptation techniques. NLE with RTSL further improves the classification accuracy.
研究动机与目标
- 解决声学场景分类(ASC)中长期存在的设备失配问题,即在某一设备上训练的模型在其他设备上性能下降的问题。
- 克服传统知识蒸馏的局限性,后者通常需要成对的源-目标数据或相似领域数据。
- 利用声学场景类别之间的内在结构关系,提升领域自适应的鲁棒性。
- 开发一种仅使用未配对的目标数据和NLE向量,即可将知识从源设备迁移至目标设备的方法。
- 通过将场景类别之间的语义关系编码为低维标签嵌入,提升模型的泛化能力。
提出的方法
- 在Device A的数据上训练一个源域模型(AlexNet-L),生成每个类别的软标签分布。
- 将神经标签嵌入(NLE)计算为源模型中软标签分布的类特定中心点。
- 通过最小化学生模型与教师模型输出之间的关系结构差异,应用关系知识蒸馏(RTSL),并将NLE作为关系先验。
- 仅使用目标域数据(Device B或C)和NLE向量对学生的模型进行适应,无需成对的源-目标样本。
- 使用SKLD-based t-SNE和PCA对NLE中编码的结构关系进行可视化与验证,以确认其在声学场景中的有效性。
- 通过引入NLE引导的关系约束,利用交叉熵损失优化学生模型,以保持类别之间的语义相似性。
实验结果
研究问题
- RQ1神经标签嵌入(NLE)是否能以设备无关的方式有效编码声学场景类别之间的结构关系?
- RQ2当缺乏成对的源-目标数据时,基于NLE的关系知识蒸馏(RTSL)是否能提升声学场景分类中的领域自适应性能?
- RQ3在设备不匹配的情况下,基于NLE的适应方法与传统的单热编码和软标签知识蒸馏在准确率上相比如何?
- RQ4RTSL中的关系约束在多大程度上增强了模型在不同录音设备上的泛化能力?
- RQ5NLE向量的可视化是否能证实声学场景之间存在有意义的语义聚类?
主要发现
- 基于NLE的适应方法在Device B上达到58.7%的准确率,在Device C上达到62.0%,优于单热编码适应(分别为57.0%和60.8%)。
- 所提出的NLE-RTSL框架在Device B上达到59.2%的准确率,在Device C上达到64.2%,相较于单热编码适应在Device C上提升了4.2%。
- 通过t-SNE和PCA的可视化分析证实,NLE向量保留了语义关系,聚类对应于公共室内、室外和交通类场景。
- NLE向量形成了紧凑且稳定的类别关系表示,降低了对噪声软标签的敏感性。
- 与标准软标签蒸馏相比,使用NLE的关系蒸馏显著提升了性能,表明关系归纳偏置能有效增强知识迁移。
- 该方法成功在未见设备上实现模型适应,且无需成对的源-目标数据,验证了其在真实场景部署中的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。