Skip to main content
QUICK REVIEW

[论文解读] Multi-site benchmark classification of major depressive disorder using machine learning on cortical and subcortical measures

V. Belov, Tracy Erwin-Grabner|arXiv (Cornell University)|Jun 16, 2022
Functional Brain Connectivity Studies被引用 7
一句话总结

本研究提出了迄今为止最大规模的多中心机器学习基准,用于利用来自5,356名参与者的多个站点的皮层和皮层下脑部测量数据,对重度抑郁障碍(MDD)进行分类。通过使用标准化的ENIGMA流程和ComBat整合,模型在区分MDD与健康对照组时达到了62%的平衡准确率,但在整合后下降至52%,凸显了尽管实现了大规模数据整合,其泛化能力仍面临挑战。

ABSTRACT

Machine learning (ML) techniques have gained popularity in the neuroimaging field due to their potential for classifying neuropsychiatric disorders. However, the diagnostic predictive power of the existing algorithms has been limited by small sample sizes, lack of representativeness, data leakage, and/or overfitting. Here, we overcome these limitations with the largest multi-site sample size to date (n=5,356) to provide a generalizable ML classification benchmark of major depressive disorder (MDD). Using brain measures from standardized ENIGMA analysis pipelines in FreeSurfer, we were able to classify MDD vs healthy controls (HC) with around 62% balanced accuracy, but when harmonizing the data using ComBat balanced accuracy dropped to approximately 52%. Similar results were observed in stratified groups according to age of onset, antidepressant use, number of episodes and sex. Future studies incorporating higher dimensional brain imaging/phenotype features, and/or using more advanced machine and deep learning methods may achieve more encouraging prospects.

研究动机与目标

  • 建立一个可泛化的、大规模的基准,用于使用神经影像数据进行重度抑郁障碍(MDD)的机器学习分类。
  • 通过利用包含5,356名参与者的多中心数据集,克服以往研究的局限性,包括样本量小、数据泄露和过拟合问题。
  • 评估使用ComBat进行数据整合对模型性能及在不同影像采集站点间泛化能力的影响。
  • 评估模型在临床相关亚组中的表现,包括发病年龄、抗抑郁药使用情况、发作次数和性别。
  • 为未来基于结构磁共振成像特征的MDD分类提供一个标准化、可重复的机器学习研究框架。

提出的方法

  • 利用ENIGMA联盟在多个站点通过标准化FreeSurfer流程获得的皮层和皮层下脑部形态测量数据。
  • 应用ComBat对多中心神经影像数据中的批次效应进行校正,确保在模型训练前完成数据整合。
  • 使用平衡准确率作为主要指标,训练并评估多种用于MDD与健康对照组二分类的机器学习模型。
  • 针对发病年龄、抗抑郁药使用情况、抑郁发作次数和性别等亚组定义进行分层分析,以评估模型的稳健性。
  • 采用10折交叉验证结合嵌套交叉验证,以防止数据泄露并确保性能估计的可靠性。
  • 使用平衡准确率评估模型性能,该指标适用于类别不平衡的数据集,并报告了95%的置信区间。

实验结果

研究问题

  • RQ1使用多中心皮层和皮层下MRI测量数据,对MDD与健康对照组进行分类,所能达到的最大平衡准确率是多少?
  • RQ2使用ComBat进行数据整合如何影响MDD分类中机器学习模型的泛化能力和性能?
  • RQ3模型性能在临床相关亚组(如发病年龄、抗抑郁药使用情况、发作次数和性别)中如何变化?
  • RQ4多中心数据中的批次效应在多大程度上损害了MDD分类模型的可靠性和可重复性?
  • RQ5大规模、整合后的数据集能否支持未来MDD机器学习研究的稳健且可泛化的基准?

主要发现

  • 机器学习模型在使用未整合的多中心数据时,对MDD与健康对照组的分类达到了62%的平衡准确率。
  • 在应用ComBat进行数据整合后,平衡准确率下降至约52%,表明批次效应对模型性能有显著影响。
  • 分层分析显示,无论在发病年龄、抗抑郁药使用情况、发作次数还是性别定义的亚组中,性能均出现一致下降。
  • 本研究表明,即使样本量达到5,356名参与者,由于残留的站点特异性变异,模型泛化依然具有挑战性。
  • 结果表明,未来提升MDD分类性能可能需要更高维的神经影像或表型特征,以及更先进的深度学习架构。
  • 本研究确立了MDD分类的基准,强调了数据整合的关键作用,同时揭示了当前形态测量特征在实现高诊断准确率方面的局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。