Skip to main content
QUICK REVIEW

[论文解读] An Ensemble of Deep Learning Frameworks Applied For Predicting Respiratory Anomalies

Lam Pham, Dat Ngo|arXiv (Cornell University)|Jan 9, 2022
Voice and Speech Disorders被引用 5
一句话总结

本论文提出了一种深度学习框架的集成方法——具体而言,结合基于Inception的模型(Inc-03)与使用预训练VGG14的迁移学习,采用早期、中期和晚期融合策略,在ICBHI基准数据集上对呼吸异常(正常、喘息、爆裂音、两者均有)进行分类。晚期融合方法取得了57.3%的最高ICBHI得分,通过融合两种架构的互补特征,优于当前最先进方法。

ABSTRACT

In this paper, we evaluate various deep learning frameworks for detecting respiratory anomalies from input audio recordings. To this end, we firstly transform audio respiratory cycles collected from patients into spectrograms where both temporal and spectral features are presented, referred to as the front-end feature extraction. We then feed the spectrograms into back-end deep learning networks for classifying these respiratory cycles into certain categories. Finally, results from high-performed deep learning frameworks are fused to obtain the best score. Our experiments on ICBHI benchmark dataset achieve the highest ICBHI score of 57.3 from a late fusion of inception based and transfer learning based deep learning frameworks, which outperforms the state-of-the-art systems.

研究动机与目标

  • 评估基于Inception的模型与大规模预训练深度学习模型在从音频记录中分类呼吸异常方面的有效性。
  • 探究使用AudioSet预训练模型进行迁移学习是否相比从零开始训练能显著提升在呼吸周期分类下游任务中的性能。
  • 确定轻量化、低参数量的架构(如MobileNet、Inception)是否在该特定任务上优于大型模型(如ResNet50、DenseNet)。
  • 探索融合策略(早期、中期、晚期)以整合多样化深度学习框架的预测结果,从而提升分类性能。
  • 通过高绩效模型的晚期融合,在ICBHI 2017基准数据集上建立新的SOTA结果。

提出的方法

  • 将10秒的呼吸音频周期转换为小波基谱图(124×154)用于基于Inception的模型,以及对数梅尔谱图用于迁移学习框架。
  • 训练了三种不同的深度学习流水线:(1) 轻量化基于Inception的网络(Inc-03),(2) 在ICBHI上微调的大规模预训练模型(VGG16、ResNet50等),(3) 使用AudioSet预训练VGG14提取嵌入向量,并通过最终的MLP分类器进行分类。
  • 实施三种融合策略:早期融合(连接全局池化特征)、中期融合(连接FC(fc2)特征)和晚期融合(预测概率的PROD融合)。
  • 应用PROD融合:$\bar{p}_{c} = \frac{1}{S}\prod_{s=1}^{S}\bar{p}_{sc}$,其中$\bar{p}_{sc}$为第$s$个模型对类别$c$的预测概率,$\hat{y} = \arg\max(\bar{p}_1, \dots, \bar{p}_C)$。
  • 采用60/40的训练-测试划分,且不包含重叠患者,遵循ICBHI官方评估协议。
  • 使用标准ICBHI指标评估模型:敏感度(Sen.)、特异度(Spec.)和ICBHI得分(Sen.与Spec.的调和平均值)。

实验结果

研究问题

  • RQ1基于Inception的轻量化深度学习架构是否在分类呼吸异常方面优于如ResNet50或DenseNet201等大型基准模型?
  • RQ2使用AudioSet预训练模型进行迁移学习是否相比从零开始训练能显著提升在ICBHI数据集上的性能?
  • RQ3对来自不同模型(基于Inception与迁移学习)的预测结果进行早期、中期或晚期融合,是否能进一步提升分类性能,超越单一模型表现?
  • RQ4将Inc-03与预训练VGG14的预测结果进行晚期融合,是否是最有效的提升ICBHI得分的策略?
  • RQ5所提出的集成系统是否在ICBHI 2017基准数据集上实现了新的SOTA性能?

主要发现

  • 结合Inc-03与预训练VGG14的晚期融合策略取得了57.3%的最高ICBHI得分,在官方ICBHI 60/40划分上超越了所有先前发表的系统。
  • 使用预训练VGG14的迁移学习框架实现了28.1%的敏感度与82.1%的特异度,ICBHI得分为55.1%,为最佳单模型表现。
  • Inc-03基于Inception的模型实现了28.4%的敏感度与81.7%的特异度,ICBHI得分为55.1%,展现了在极低参数量下的强劲性能。
  • 迁移学习显著优于直接训练MobileNetV1与MobileNetV2,表明其在低资源呼吸音分类任务中的有效性。
  • 与最佳单模型(55.1% → 57.3%)相比,晚期融合使ICBHI得分提升了2.2个百分点,证实了两种模型提取了互补特征。
  • 该集成系统优于表VI中列出的所有SOTA方法,包括ResNet50(56.2%)与CNN-RNN(54.0%),在ICBHI基准上确立了新的SOTA性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。