Skip to main content
QUICK REVIEW

[논문 리뷰] Stool Studies Don't Pass the Sniff Test: A Systematic Review of Human Gut Microbiome Research Suggests Widespread Misuse of Machine Learning

Thomas P. Quinn|arXiv (Cornell University)|2021. 07. 08.
Machine Learning in Healthcare참고 문헌 7인용 수 8
한 줄 요약

이 체계적 리뷰는 102개의 인간 장내 미생물군집 분류 연구를 분석하여, 88%의 연구에서 테스트 세트 누락 또는 泄露로 인해 AUC 값이 잘못 보고되었으며, 이는 기계학습 모델이 진단 또는 예후 잠재력을 지닌다고 주장하는 데 신뢰를 떨어뜨린다. 유일하게 진정으로 독립된 테스트 세트를 사용한 연구는 12%에 불과하여, 장내 미생물군집 기반 생물학적 표지자 연구의 신뢰성에 심각한 의문을 제기한다.

ABSTRACT

In the machine learning culture, an independent test set is required for proper model verification. Failures in model verification, including test set omission and test set leakage, make it impossible to know whether or not a trained model is fit for purpose. In this article, we present a systematic review and quantitative analysis of human gut microbiome classification studies, conducted to measure the frequency and impact of test set omission and test set leakage on area under the receiver operating curve (AUC) reporting. Among 102 articles included for analysis, we find that only 12% of studies report a bona fide test set AUC, meaning that the published AUCs for 88% of studies cannot be trusted at face value. Our findings cast serious doubt on the general validity of research claiming that the gut microbiome has high diagnostic or prognostic potential in human disease.

연구 동기 및 목표

  • 인간 장내 미생물군집 분류 연구에서 기계학습 방법의 부적절한 사용 빈도와 영향을 평가하기 위해.
  • 테스트 세트 누락 및 泄露가 모델 성능의 핵심 지표인 AUC 값에 어떤 영향을 미치는지 평가하기 위해.
  • 장내 미생물군집이 신뢰할 수 있는 진단 또는 예후 생물학적 표지자로 기능할 수 있다는 주장의 타당성을 도전하기 위해.
  • 재현 가능성에 위협이 되는, 보고 및 검증 관행의 체계적 문제를 부각하기 위해.

제안 방법

  • PubMed를 이용해 장, 변비, 대변, 미생물군집 및 AUC와 관련된 关련 키워드를 사용하여 체계적 문헌 검색을 수행하였다.
  • 엄격한 포함 및 배제 기준을 적용하여 초록에 AUC를 보고한 인간 장내 미생물군집 분류 연구를 선별하였다.
  • 연구 설계, 표본 크기, 분류 알고리즘, 시퀀싱 방법 및 훈련, 검증, 테스트 세트에서의 AUC 보고 내용을 추출하였다.
  • 진정한 독립된 테스트 세트가 사용되었는지 여부와 유출 여부를 기반으로 모델 검증 품질을 평가하였다.
  • 적절한 테스트 세트를 사용한 연구와 누락 또는 유출이 발생한 연구 간의 AUC 값에 대한 정량적 비교를 수행하였다.
  • 통계 분석을 통해 부적절한 검증 관행으로 인한 AUC 과대평가 정도를 추정하였다.

실험 결과

연구 질문

  • RQ1인간 장내 미생물군집 분류 연구에서 테스트 세트를 누락하거나 부적절하게 사용하는 빈도는 어느 정도인가?
  • RQ2테스트 세트 누락 또는 유출이 미생물군집 연구에서 보고된 AUC 값에 얼마나 큰 영향을 미치는가?
  • RQ3진정한 테스트 세트를 사용한 연구와 사용하지 않은 연구 간의 AUC 성능에 어떤 차이가 있는가?
  • RQ4기계학습 방법의 오용이 장내 미생물군집이 임상 생물학적 표지자로 간주되는 주장의 신뢰성에 어떤 영향을 미치는가?

주요 결과

  • 포함된 102개 연구 중 진정한 독립된 테스트 세트에서 산출된 AUC를 보고한 연구는 오직 12%에 불과하여, 88%의 연구가 적절한 모델 검증을 수행하지 못했다.
  • 진정한 테스트 세트를 사용하지 않은 연구는 유의미하게 높은 AUC를 보고하였으며, 정규화된 95% 신뢰구간에서 적절히 검증된 연구와 비교해 2.3에서 11.1 포인트의 차이를 보였다.
  • 기계학습의 광범위한 오용—특히 테스트 세트 누락 및 유출—로 인해 과도하게 낙관적이고 잠재적으로 오해의 소지가 있는 성능 지표가 발생한다.
  • 분류기가 우연보다 나아지지 못한 경우는 한 번도 발견되지 않았으며, 이는 검증 방법이 잘못되었음에도 불구하고 긍정 결과를 선호하는 출판 편향이 존재할 가능성을 시사한다.
  • 결과적으로, 문헌에서 주장하는 바와 같이 장내 미생물군집의 진단 또는 예후 잠재력은 방법론적 결함으로 인해 상당히 과대평가된 것으로 암시된다.
  • 이러한 결과는 임상 기계학습 및 미생물군집 연구 분야에서 재현성과 강건성에 대한 광범위한 우려와 일치하며, 향후 보다 향상된 보고 기준이 필요하다는 점을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.