Skip to main content
QUICK REVIEW

[论文解读] ECO-AMLP: A Decision Support System using an Enhanced Class Outlier with Automatic Multilayer Perceptron for Diabetes Prediction

Maham Jahangir, Hammad Afzal|arXiv (Cornell University)|Jun 23, 2017
Artificial Intelligence in Healthcare参考文献 50被引用 4
一句话总结

本文提出 ECO-AMLP,一种混合决策支持系统,将增强类异常检测(ECODB)与 AutoMLP 相结合,以提高糖尿病预测的准确性。通过使用基于距离的类异常因子去除异常值,并应用自动调优的多层感知机集成,该框架在 Pima 印第安人糖尿病数据集上实现了 88.7% 的准确率,优于所有先前报告的方法。

ABSTRACT

With advanced data analytical techniques, efforts for more accurate decision support systems for disease prediction are on rise. Surveys by World Health Organization (WHO) indicate a great increase in number of diabetic patients and related deaths each year. Early diagnosis of diabetes is a major concern among researchers and practitioners. The paper presents an application of extit{Automatic Multilayer Perceptron }which extit{ }is combined with an outlier detection method extit{Enhanced Class Outlier Detection using distance based algorithm }to create a prediction framework named as Enhanced Class Outlier with Automatic Multi layer Perceptron (ECO-AMLP). A series of experiments are performed on publicly available Pima Indian Diabetes Dataset to compare ECO-AMLP with other individual classifiers as well as ensemble based methods. The outlier technique used in our framework gave better results as compared to other pre-processing and classification techniques. Finally, the results are compared with other state-of-the-art methods reported in literature for diabetes prediction on PIDD and achieved accuracy of 88.7\% bests all other reported studies.

研究动机与目标

  • 通过结合稳健的预处理与先进的机器学习技术,解决糖尿病预测系统准确率低下的挑战。
  • 通过使用 AutoMLP(一种自动调优的多层感知机集成)减少神经网络中对手动超参数调优的依赖。
  • 通过使用一种新型基于距离的类异常检测方法在训练前去除数据异常值,以提升模型性能。
  • 在基准 Pima 印第安人糖尿病数据集(PIDD)上超越现有最先进方法。
  • 利用所提出的框架识别糖尿病最具预测性的特征。

提出的方法

  • ECODB 是一种基于距离的异常值检测技术,通过概率、偏差和 K-最近邻距离计算类异常因子,以识别并从数据集中移除异常值。
  • 预处理后的数据被输入到 AutoMLP 中,该模型由四个多层感知机构成,可自动调优网络结构,包括隐藏层、神经元数量、学习率和训练轮数。
  • 该框架将 ECODB 预处理与 AutoMLP 分类相结合,形成 ECO-AMLP,一种用于糖尿病预测的混合决策支持系统。
  • 使用标准指标(准确率、加权平均精确率(WMP)和加权平均召回率(WMR))在 Pima 印第安人糖尿病数据集(PIDD)上评估性能。
  • 将该方法与单个分类器(如 KNN、朴素贝叶斯、SVM)、集成方法(如 Bagging、AdaBoost)以及多种人工神经网络架构进行比较。
  • 分析特征重要性,以识别关键预测因子,如血浆葡萄糖浓度、舒张压和怀孕次数。

实验结果

研究问题

  • RQ1结合异常值检测与自动调优神经网络的混合框架是否能够使糖尿病预测准确率超越现有方法?
  • RQ2ECODB 预处理与传统技术(如归一化、特征选择和采样)相比,在提升模型性能方面表现如何?
  • RQ3AutoMLP 在糖尿病预测任务中是否始终优于单个神经网络架构?
  • RQ4根据 ECO-AMLP 框架,哪些临床特征对糖尿病最具预测性?
  • RQ5在 Pima 印第安人糖尿病数据集上,ECO-AMLP 在准确率、精确率和召回率方面与最先进方法相比表现如何?

主要发现

  • ECO-AMLP 在 Pima 印第安人糖尿病数据集上实现了 88.7% 的准确率,这是该基准数据集迄今为止报告的最高准确率。
  • ECODB 异常值检测方法在提升模型性能方面优于归一化、特征选择、属性加权和采样技术。
  • 与单个神经网络架构(包括标准 MLP、RBF 网络和感知器)相比,AutoMLP 展现出更优越的性能。
  • 该框架实现了 88.56% 的加权平均召回率和 85.83% 的加权平均精确率,表明其在灵敏度与精确率之间具有良好的平衡。
  • 血浆葡萄糖浓度、舒张压和怀孕次数被确定为糖尿病预测中最相关的特征。
  • 在准确率和鲁棒性方面,ECO-AMLP 超过了所有先前报告的方法,包括复值神经网络、神经模糊系统和元学习器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。