Skip to main content
QUICK REVIEW

[论文解读] Machine learning based disease diagnosis: A comprehensive review

Md Manjurul Ahsan, Zahed Siddique|arXiv (Cornell University)|Dec 31, 2021
COVID-19 diagnosis using AI被引用 4
一句话总结

本篇全面综述分析了2012年至2021年间机器学习(ML)与深度学习(DL)在疾病诊断中的应用,识别出关键趋势、算法及数据类型。研究发现,卷积神经网络(CNNs)是使用最广泛且最有效的技术,其在疾病检测中的准确率超过90%,主要聚焦于癌症、糖尿病、心脏病和新冠肺炎。

ABSTRACT

Globally, there is a substantial unmet need to diagnose various diseases effectively. The complexity of the different disease mechanisms and underlying symptoms of the patient population presents massive challenges to developing the early diagnosis tool and effective treatment. Machine Learning (ML), an area of Artificial Intelligence (AI), enables researchers, physicians, and patients to solve some of these issues. Based on relevant research, this review explains how Machine Learning (ML) and Deep Learning (DL) are being used to help in the early identification of numerous diseases. To begin, a bibliometric study of the publication is given using data from the Scopus and Web of Science (WOS) databases. The bibliometric study of 1216 publications was undertaken to determine the most prolific authors, nations, organizations, and most cited articles. The review then summarizes the most recent trends and approaches in Machine Learning-based Disease Diagnosis (MLBDD), considering the following factors: algorithm, disease types, data type, application, and evaluation metrics. Finally, the paper highlights key results and provides insight into future trends and opportunities in the MLBDD area.

研究动机与目标

  • 确定2012年至2021年间基于机器学习的疾病诊断研究中最常针对的疾病。
  • 分析在医学诊断中使用最频繁的机器学习与深度学习算法。
  • 利用标准评估指标在多种疾病类型中评估机器学习模型的性能。
  • 突出临床机器学习应用中的关键挑战,如数据不平衡、模型可解释性及伦理问题。
  • 通过识别模型可解释性、公平性与鲁棒性方面的研究空白,为未来研究提供指导。

提出的方法

  • 基于Scopus和Web of Science的1,216篇文献开展文献计量分析,以绘制作者合作、所属国家、机构及引用影响力的趋势图。
  • 系统性回顾应用于疾病诊断的机器学习与深度学习技术,重点关注算法类型、疾病类别、数据模态(如影像、表格数据)及应用场景。
  • 对不同研究中的性能指标(如准确率、灵敏度、特异性及AUC-ROC)进行分类与比较,以评估诊断的可靠性。
  • 评估深度学习架构(尤其是卷积神经网络(CNNs))在基于影像的诊断(如X光、MRI)中的作用。
  • 评估数据不平衡、缺乏模型可解释性以及自动化诊断中偏见与责任归属等伦理问题等挑战。
  • 提出未来研究方向,包括可解释人工智能(XAI)、多类别与不平衡数据集的处理,以及安全的云部署以支持可扩展的医疗系统。

实验结果

研究问题

  • RQ1在2012年至2021年期间,基于机器学习的疾病诊断研究中,哪些疾病被最频繁研究?
  • RQ2在疾病诊断中,哪些机器学习与深度学习算法最常被使用,其流行的原因是什么?
  • RQ3不同疾病类型与数据模态下,准确率、AUC-ROC与F1得分等评估指标如何变化?
  • RQ4哪些关键挑战(如数据不平衡、模型可解释性与公平性)阻碍了基于机器学习的诊断系统在临床中的应用?
  • RQ5为推进可靠、伦理且可扩展的基于机器学习的疾病诊断系统,未来哪些研究方向最为关键?

主要发现

  • 卷积神经网络(CNNs)是基于机器学习的疾病诊断中使用最广泛且最有效的深度学习架构,尤其在医学影像应用中表现突出。
  • 基于机器学习的诊断模型在检测乳腺癌、阿尔茨海默病、心脏病和肺炎等疾病时,准确率超过90%,尤其是在使用影像数据时表现更优。
  • 研究最多的疾病包括乳腺癌、糖尿病、心脏病、肾病、阿尔茨海默病、帕金森病,以及近年来因疫情而受到关注的新冠肺炎与肺炎。
  • 尽管应用广泛,大多数研究未能解决数据不平衡问题,而这种不平衡在真实临床数据集中十分常见。
  • 模型可解释性仍是主要短板——尽管对透明且可信的诊断系统的需求日益增长,但很少有研究整合可解释人工智能(XAI)技术。
  • 未来研究应优先关注高度不平衡且存在缺失数据的多类别分类问题,整合XAI技术,并推动安全的云部署,以支持医疗领域中可扩展且合乎伦理的机器学习应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。