Skip to main content
QUICK REVIEW

[论文解读] Stool Studies Don't Pass the Sniff Test: A Systematic Review of Human Gut Microbiome Research Suggests Widespread Misuse of Machine Learning

Thomas P. Quinn|arXiv (Cornell University)|Jul 8, 2021
Machine Learning in Healthcare参考文献 7被引用 8
一句话总结

本篇系统性综述分析了102项关于人类肠道微生物组分类的研究,发现88%的研究因测试集遗漏或数据泄露而错误报告AUC值,严重削弱了声称具有诊断或预后潜力的机器学习模型的可信度。仅有12%的研究使用了真正的独立测试集,这使得基于微生物组生物标志物研究的可靠性受到严重质疑。

ABSTRACT

In the machine learning culture, an independent test set is required for proper model verification. Failures in model verification, including test set omission and test set leakage, make it impossible to know whether or not a trained model is fit for purpose. In this article, we present a systematic review and quantitative analysis of human gut microbiome classification studies, conducted to measure the frequency and impact of test set omission and test set leakage on area under the receiver operating curve (AUC) reporting. Among 102 articles included for analysis, we find that only 12% of studies report a bona fide test set AUC, meaning that the published AUCs for 88% of studies cannot be trusted at face value. Our findings cast serious doubt on the general validity of research claiming that the gut microbiome has high diagnostic or prognostic potential in human disease.

研究动机与目标

  • 评估人类肠道微生物组分类研究中不当机器学习实践的频率及其影响。
  • 评估测试集遗漏和数据泄露对报告AUC值的影响,AUC值是衡量模型性能的关键指标。
  • 质疑肠道微生物组作为可靠诊断或预后生物标志物的声明的有效性。
  • 突出报告和验证实践中的系统性问题,这些问题威胁到微生物组和临床人工智能研究的可重复性。

提出的方法

  • 使用PubMed进行系统性文献检索,关键词包括肠道、粪便、粪样、微生物组和AUC。
  • 应用严格的纳入与排除标准,识别在摘要中报告AUC的人类肠道微生物组分类研究。
  • 提取关于研究设计、样本量、分类算法、测序方法以及在训练集、验证集和测试集上报告的AUC值的数据。
  • 根据是否使用真正的独立测试集以及是否存在数据泄露,评估模型验证质量。
  • 对正确使用测试集的研究与存在遗漏或数据泄露的研究之间的AUC值进行定量比较。
  • 使用统计分析估算不当验证实践导致的AUC值膨胀程度。

实验结果

研究问题

  • RQ1人类肠道微生物组分类研究在多大程度上遗漏或不当使用测试集?
  • RQ2测试集遗漏或数据泄露在多大程度上导致微生物组研究中报告的AUC值被高估?
  • RQ3使用真正测试集的研究与未使用的研究在AUC表现上存在多大差异?
  • RQ4机器学习实践的误用如何影响肠道微生物组作为临床生物标志物声明的可信度?

主要发现

  • 在纳入的102项研究中,仅有12%报告了来自独立测试集的真实AUC值,表明88%的研究未能进行适当的模型验证。
  • 未使用真正测试集的研究报告的AUC值显著更高,与经过正确验证的研究相比,95%置信区间显示差异为2.3至11.1个百分点。
  • 机器学习的广泛误用——尤其是测试集遗漏和数据泄露——导致性能指标过于乐观,可能具有误导性。
  • 研究未发现任何分类器表现不优于随机猜测的情况,表明尽管验证方法存在缺陷,仍存在偏向正面结果的发表偏倚。
  • 结果表明,文献中声称的肠道微生物组在诊断或预后方面的潜力,可能因方法学缺陷而被严重高估。
  • 研究结果与临床机器学习和微生物组研究中关于可重复性和稳健性的更广泛担忧一致,强调了改进报告标准的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。