Skip to main content
QUICK REVIEW

[论文解读] Diagnosis of Acute Myeloid Leukaemia Using Machine Learning

A. Angelakis, Ioanna Soulioti|arXiv (Cornell University)|Aug 17, 2021
Digital Imaging for Blood Diseases参考文献 79被引用 5
一句话总结

本研究利用26个未经标注的基因探针集和年龄,开发了一种CatBoost机器学习模型,用于诊断急性骨髓性白血病(AML),在来自15个国家的2,177名个体的多中心数据集中,准确率达到99.94%,F1得分达到0.9996。该模型通过聚焦于此前未在文献中与AML相关联的特征,超越了现有方法,揭示了用于诊断的新分子特征。

ABSTRACT

We train a machine learning model on a dataset of 2177 individuals using as features 26 probe sets and their age in order to classify if someone has acute myeloid leukaemia or is healthy. The dataset is multicentric and consists of data from 27 organisations, 25 cities, 15 countries and 4 continents. The accuracy or our model is 99.94\% and its F1-score 0.9996. To the best of our knowledge the performance of our model is the best one in the literature, as regards the prediction of AML using similar or not data. Moreover, there has not been any bibliographic reference associated with acute myeloid leukaemia for the 26 probe sets we used as features in our model.

研究动机与目标

  • 开发一种使用最少且具有生物相关性的特征的高精度机器学习模型,用于急性骨髓性白血病(AML)的早期诊断。
  • 识别此前未与AML相关联的新型基因表达特征(探针集),从而发现潜在的新生物标志物。
  • 将年龄作为预后特征纳入模型以提升性能,利用其在AML预后中已知的临床相关性。
  • 在经过筛选的、来自多个大洲的多中心基因表达数据集上,实现AML分类的最先进性能。
  • 通过10折交叉验证和独立测试集验证模型的稳健性,确保其在多样化人群中的泛化能力。

提出的方法

  • 采用两阶段特征选择流程:首先根据CatBoost的预测重要性,选择前100个最重要的特征;其次根据训练过程中损失函数减少的贡献,选择前100个特征。
  • 计算这两个特征集的交集(共34个探针集),以保留具有高预测能力且对模型优化有显著贡献的特征。
  • 从这34个探针集中,仅保留26个用于最终模型,排除任何在文献中已知与AML相关的探针集,以确保所选特征的创新性。
  • 使用100次迭代、深度为11、初始学习率为0.1的CatBoost分类器,在最终包含2,177名个体的数据集上进行训练,其中80%用于训练,20%用于验证。
  • 采用10折交叉验证以调整超参数,并评估模型的稳定性和泛化性能。
  • 通过CatBoost内置的权重平衡机制处理类别不平衡问题,以提升对少数类(健康个体)的性能。

实验结果

研究问题

  • RQ1仅使用26个基因探针集和年龄、且此前未在文献中与AML相关联的机器学习模型,能否在AML诊断中实现接近完美的准确率?
  • RQ2通过双重重要性标准(预测重要性与损失函数变化)选择的特征,是否相比单一标准选择能带来更优的诊断性能?
  • RQ3在结合新型基因表达特征的情况下,将年龄作为特征是否显著提升机器学习模型在AML诊断中的性能?
  • RQ4在包含2,177名个体的多中心国际数据集上训练的模型,能否在不同人群和检测平台间实现良好的泛化能力?
  • RQ5仅使用新型、未经标注的探针集的模型在AML诊断中的表现如何?与现有文献中的方法相比有何差异?

主要发现

  • 最终的CatBoost模型在测试集上实现了99.94%的准确率和0.9996的F1得分,表现出卓越的诊断性能。
  • 模型保持了极高的特异性(1.0000)和敏感性(1.0000),表明对AML和健康个体的识别近乎完美。
  • AUC得分达到1.0000,表明在验证集中对AML与健康个体的判别能力完美。
  • 用于最终模型的26个探针集在文献中均未与AML相关联,表明发现了用于AML诊断的新分子特征。
  • 尽管年龄是唯一具有临床注释的变量,但其作为特征的引入显著提升了模型性能。
  • 根据作者的文献综述,该模型在使用相似或不同数据类型的AML诊断模型中表现优于所有已报道的现有模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。