[论文解读] Murmur Detection Using Parallel Recurrent & Convolutional Neural Networks.
本文提出一种并行深度学习架构,结合双向长短期记忆网络(BiLSTM)与卷积神经网络(CNN)模型,利用梅尔频率倒谱系数(MFCC)特征和频谱图对心音进行正常或杂音分类。该方法在大规模、多样化的PCG数据集上通过5折交叉验证,实现了96.09%的敏感度、100%的特异度和98.01%的F1分数,优于单一网络模型,且无需依赖心跳节拍分割或起始点检测。
In this article, we propose a novel technique for classification of the Murmurs in heart sound. We introduce a novel deep neural network architecture using parallel combination of the Recurrent Neural Network (RNN) based Bidirectional Long Short-Term Memory (BiLSTM) & Convolutional Neural Network (CNN) to learn visual and time-dependent characteristics of Murmur in PCG waveform. Set of acoustic features are presented to our proposed deep neural network to discriminate between Normal and Murmur class. The proposed method was evaluated on a large dataset using 5-fold cross-validation, resulting in a sensitivity and specificity of 96 +- 0.6 % , 100 +- 0 % respectively and F1 Score of 98 +- 0.3 %.
研究动机与目标
- 开发一种无需依赖人工心跳节拍分割或起始点检测的自动化、鲁棒分类器,以区分正常心音与杂音。
- 解决传统手工特征提取方法对噪声和数据分布偏移敏感的局限性。
- 通过联合建模时间依赖性(通过BiLSTM)和频谱模式(通过CNN),提升心音图(PCG)信号的分类性能。
- 在包含真实世界噪声、运动伪影及多种病理状况的大型多样化数据集上评估模型性能,以确保其泛化能力。
提出的方法
- 该模型采用并行架构,先通过一个3层CNN(含ReLU激活函数和批量归一化),随后进行最大池化和L2正则化,从65×61的频谱图中提取空间-频谱特征。
- 一个两层BiLSTM网络处理长度为398帧、维度为13的MFCC序列,以捕捉心音周期中的长期时间模式。
- 在全连接层(各128个单元)后,将CNN和BiLSTM的输出拼接,形成256维的融合表示。
- 将融合表示输入第二个全连接层(128个单元)和一个具有两个神经元的Softmax输出层,实现二分类(正常 vs. 杂音)。
- 网络使用交叉熵损失函数进行训练,固定初始学习率为1e-3,小批量大小为128,并在所有层应用80%的Dropout以防止过拟合。
- 通过在每折训练中对少数类(杂音)进行过采样来缓解类别不平衡问题,而测试集保持不变且具有受试者不变性,以避免数据泄露。
实验结果
研究问题
- RQ1并行CNN-BiLSTM架构是否能有效从PCG信号中学习到频谱与时间特征,实现杂音分类,而无需依赖心跳节拍分割?
- RQ2在相同数据集上,所提出的CNN-BiLSTM联合模型相较于单独的CNN或BiLSTM模型,性能表现如何?
- RQ3该方法在包含不同噪声、伪影及病理状况的多样化PCG记录中,其泛化能力达到何种程度?
- RQ4当在不平衡数据上训练时,该模型是否能在不依赖可能引入偏差的数据增强技术的前提下,仍保持高特异度与敏感度?
主要发现
- 所提出的BiLSTM + CNN模型在5折交叉验证中实现了96.09%的敏感度、100%的特异度和98.01%的F1分数,显著优于独立的CNN和BiLSTM模型。
- 独立CNN模型实现87.04%的敏感度和100%的特异度,而独立BiLSTM模型实现97.14%的敏感度和85.49%的特异度,表明存在类别特异性偏差。
- 并行架构有效缓解了各模型的固有缺陷:CNN在处理含噪声的正常心音时表现不佳,而BiLSTM易将周期性杂音误分类为正常。
- 模型对类别不平衡具有鲁棒性,通过训练阶段的类别特定过采样实现,且未损害测试集完整性。
- 该系统无需进行心跳节拍分割或起始点检测,降低了对易出错的预处理步骤的依赖,提升了实际应用中的可行性。
- 结果表明,联合建模视觉特征(频谱图)与时间特征(MFCC序列)可显著提升分类性能,优于基于特征工程的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。