[论文解读] AI Framework for Early Diagnosis of Coronary Artery Disease: An Integration of Borderline SMOTE, Autoencoders and Convolutional Neural Networks Approach
该论文提出了一种新颖的AI框架,结合Borderline SMOTE进行数据平衡,使用自编码器进行特征学习和数据增强,并采用9层卷积神经网络(CNN)实现冠状动脉疾病(CAD)的早期诊断。该方法在小型、不平衡的CAD数据集上实现了95.36%的平均准确率,优于传统的机器学习模型(如随机森林、SVM和ANN)。
The accuracy of coronary artery disease (CAD) diagnosis is dependent on a variety of factors, including demographic, symptom, and medical examination, ECG, and echocardiography data, among others. In this context, artificial intelligence (AI) can help clinicians identify high-risk patients early in the diagnostic process, by synthesizing information from multiple factors. To this aim, Machine Learning algorithms are used to classify patients based on their CAD disease risk. In this study, we contribute to this research filed by developing a methodology for balancing and augmenting data for more accurate prediction when the data is imbalanced and the sample size is small. The methodology can be used in a variety of other situations, particularly when data collection is expensive and the sample size is small. The experimental results revealed that the average accuracy of our proposed method for CAD prediction was 95.36, and was higher than random forest (RF), decision tree (DT), support vector machine (SVM), logistic regression (LR), and artificial neural network (ANN).
研究动机与目标
- 为解决冠状动脉疾病(CAD)数据集中样本量小和类别不平衡的问题,以提升早期诊断效果。
- 开发一种混合机器学习与深度学习框架,通过数据增强和特征表示提升预测准确率。
- 构建一种鲁棒且可泛化的模型,适用于其他医疗诊断任务中数据有限或类别不平衡的情况。
- 在心血管中心获取的真实世界CAD数据集上验证所提出的框架,该数据集包含详细的临床和心电图特征。
提出的方法
- 应用Borderline SMOTE对少数类样本(CAD阳性)进行过采样,同时保持决策边界清晰。
- 使用一个包含57×1输入和瓶颈层32个神经元的深度自编码器,学习输入数据的压缩且有意义的表示。
- 通过解码器重建输入数据,生成合成的、高质量的训练样本,将数据集规模从303个样本扩展至826个样本。
- 采用一个9层CNN,包含四个卷积层(每层256个滤波器,ReLU激活函数)和五个全连接层(256、128、64、32、2个神经元),并应用L2正则化和dropout(0.5)以防止过拟合。
- 通过10折交叉验证确保模型性能评估的稳健性和无偏性。
- 在GPU环境中使用Adam优化器训练CNN,学习率为0.001,批量大小为256,训练100个周期。
实验结果
研究问题
- RQ1与经典机器学习模型相比,结合Borderline SMOTE、自编码器和CNN是否能显著提升在小样本且类别不平衡的CAD数据集上的分类准确率?
- RQ2基于自编码器的数据增强策略在增加训练样本数量的同时,是否能有效保持临床相关性?
- RQ3所提出的深度学习架构在CAD诊断中,与SVM、随机森林和ANN等传统分类器相比,其性能优势有多大?
- RQ4使用类别不平衡数据处理技术是否能显著降低早期CAD检测中的误分类率?
主要发现
- 所提出的框架在10折交叉验证中实现了95.36%的平均准确率,显著优于所有基线模型。
- 模型召回率为95.00%,精确率为94.80%,F1得分为95.05%,ROC AUC为95.06%,表明其具有强大的泛化能力和鲁棒性。
- 在所有对比模型中,随机森林表现第二,准确率为94.77%,其次是SVM(94.66%),而逻辑回归和ANN表现较差。
- 利用自编码器进行数据增强有效提升了模型泛化能力,且未引入噪声或无关的合成样本。
- 结合dropout和L2正则化的CNN架构在小样本数据集上表现出对过拟合的强大抵抗能力。
- 该框架在全部10个折中表现稳定,准确率和F1得分一致,证实了其可靠性与可重复性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。