Skip to main content
QUICK REVIEW

[论文解读] Improving performance and inference on audio classification tasks using capsule networks

Royal Jain|arXiv (Cornell University)|Feb 13, 2019
Music and Audio Processing参考文献 23被引用 12
一句话总结

本文提出一种专为语音分类设计的胶囊网络架构,利用按一致性的动态路由机制提升性能与推理效果。在七个多样化的语音数据集上,该方法显著优于卷积神经网络(CNN)、长短期记忆网络(LSTM)以及基于注意力的模型,同时通过胶囊激活向量实现了对数据的深入理解与有效的迁移学习。

ABSTRACT

Classification of audio samples is an important part of many auditory systems. Deep learning models based on the Convolutional and the Recurrent layers are state-of-the-art in many such tasks. In this paper, we approach audio classification tasks using capsule networks trained by recently proposed dynamic routing-by-agreement mechanism. We propose an architecture for capsule networks fit for audio classification tasks and study the impact of various parameters on classification accuracy. Further, we suggest modifications for regularization and multi-label classification. We also develop insights into the data using capsule outputs and show the utility of the learned network for transfer learning. We perform experiments on 7 datasets of different domains and sizes and show significant improvements in performance compared to strong baseline models. To the best of our knowledge, this is the first detailed study about the application of capsule networks in the audio domain.

研究动机与目标

  • 将具备按一致性的动态路由机制的胶囊网络适配于语音分类任务,以解决卷积神经网络(CNN)和循环神经网络(RNN)在处理仿射变换和时间敏感性方面的局限性。
  • 研究架构超参数(如胶囊维度和路由迭代次数)对分类准确率的影响。
  • 通过一种新颖的正则化技术提升模型鲁棒性,该技术利用重建头对梅尔频率倒谱系数(MFCC)输入进行重建。
  • 将胶囊网络扩展至多标签语音分类任务,通过调整损失权重提升性能。
  • 探索胶囊输出在数据解释与相关语音领域迁移学习中的实用性。

提出的方法

  • 提出一种专为语音输入设计的胶囊网络架构,采用梅尔频率倒谱系数(MFCC)作为输入特征,并应用按一致性的动态路由机制,以学习分层的部件-整体关系。
  • 引入一种双流损失函数,结合边缘损失(margin loss)用于分类和平均绝对误差(MAE)用于重建,通过输入重建实现正则化。
  • 对MFCC特征应用最小-最大归一化,以稳定训练过程并防止重建损失中特征主导。
  • 对胶囊激活向量进行主成分分析(PCA),以分析幅度与速度变化对输出的影响,揭示了对姿态不变表示的学习。
  • 通过将胶囊层输出与MFCC拼接,作为下游任务中的可迁移特征,实现从源域到目标域的知识迁移。
  • 在多标签设置中使用可调超参数λ的加权二元交叉熵损失,以减少假阳性样本的影响。

实验结果

研究问题

  • RQ1胶囊网络在多样化的语音分类基准上的表现与卷积神经网络(CNN)、长短期记忆网络(LSTM)及基于注意力的模型相比如何?
  • RQ2为最大化语音分类准确率,胶囊网络的最佳胶囊维度与路由迭代次数是多少?
  • RQ3基于重建的正则化是否能提升胶囊网络的泛化能力,尤其是在小样本数据集上?
  • RQ4胶囊激活向量在输入幅度与速度受控扰动下的响应如何?这揭示了所学表征的哪些特性?
  • RQ5胶囊激活向量在多任务语音分类中作为可迁移特征的潜力有多大?

主要发现

  • 胶囊网络在全部七个数据集上均实现了高于强基线模型(CNN、LSTM、注意力模型)的分类准确率,尤其在小样本数据集(如FSDD和VCTK)上提升最为显著。
  • 存在最优的胶囊维度——准确率先上升后下降,表明模型容量与过拟合之间存在权衡。
  • 通过重建头实现的正则化显著提升了小样本数据集(如FSDD)上的性能,减少了过拟合并增强了泛化能力。
  • 在PCA空间中,当输入在幅度与速度上受到扰动时,胶囊输出表现出清晰的分离,表明输出向量编码了有意义的姿态相关信息。
  • 利用胶囊激活向量进行迁移学习,将Ravdess情感分类准确率从41%提升至50%,证明了所学特征的可迁移性。
  • 在多标签设置中,按一致性的动态路由减少了类别间的干扰,提升了Multi-VCTK与Multi-MUSAN数据集上的加权准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。