Skip to main content
QUICK REVIEW

[논문 리뷰] Predicting Patient COVID-19 Disease Severity by means of Statistical and Machine Learning Analysis of Blood Cell Transcriptome Data

Sakifa Aktar, Md. Martuza Ahamad|arXiv (Cornell University)|2020. 11. 19.
COVID-19 diagnosis using AI참고 문헌 29인용 수 14
한 줄 요약

이 연구는 일상적인 혈액 전사체 데이터를 활용한 기계학습 프레임워크를 개발하여 코로나19 질환의 중증도와 사망률을 90% 이상의 정확도로 예측한다. CRP, D-다이머, 젖산과 같은 임상 매개변수를 기반으로 통계 분석과 다양한 기계학습 알고리즘(랜덤 포레스트, 기울기 부스팅, SVM 포함)을 통합함으로써 중증 결과를 예측할 수 있는 핵심 생물학적 마커를 규명하였으며, 자원이 제한된 환경에서 조기에 위험도를 분류할 수 있도록 한다.

ABSTRACT

Introduction: For COVID-19 patients accurate prediction of disease severity and mortality risk would greatly improve care delivery and resource allocation. There are many patient-related factors, such as pre-existing comorbidities that affect disease severity. Since rapid automated profiling of peripheral blood samples is widely available, we investigated how such data from the peripheral blood of COVID-19 patients might be used to predict clinical outcomes. Methods: We thus investigated such clinical datasets from COVID-19 patients with known outcomes by combining statistical comparison and correlation methods with machine learning algorithms; the latter included decision tree, random forest, variants of gradient boosting machine, support vector machine, K-nearest neighbour and deep learning methods. Results: Our work revealed several clinical parameters measurable in blood samples, which discriminated between healthy people and COVID-19 positive patients and showed predictive value for later severity of COVID-19 symptoms. We thus developed a number of analytic methods that showed accuracy and precision for disease severity and mortality outcome predictions that were above 90%. Conclusions: In sum, we developed methodologies to analyse patient routine clinical data which enables more accurate prediction of COVID-19 patient outcomes. This type of approaches could, by employing standard hospital laboratory analyses of patient blood, be utilised to identify, COVID-19 patients at high risk of mortality and so enable their treatment to be optimised.

연구 동기 및 목표

  • 표준 병원 혈액 검사 자료를 활용해 코로나19 중증도 및 사망 위험을 조기에 예측함으로써 개선을 도모한다.
  • 입원 환자에서 중증 결과를 강력하게 예측할 수 있는 임상적으로 측정 가능한 혈액 매개변수를 규명한다.
  • 특히 자원이 제한된 환경에서 ICU 자원 배정을 위한 강력하고 자동화된 의사결정 지원 시스템을 개발한다.
  • 다양한 기계학습 모델의 성능을 정규 임상 데이터에 대해 평가하여 방법론적 안정성과 일반화 능력을 확보한다.

제안 방법

  • 건강한 개인과 코로나19 환자 간에 유의미하게 다름을 보이는 혈액 매개변수를 규명하기 위해 통계적 비교 및 상관 분석을 적용하였다.
  • 다양한 기계학습 알고리즘을 활용: 의사결정나무, 랜덤 포레스트, 기울기 부스팅(XGBoost, LightGBM), 서포트 벡터 머신(SVM), K-최근접 이웃(KNN), 딥 러닝 모델.
  • 입원 환자에서 확보된 외부 혈액 매개변수 데이터셋을 기반으로 모델을 훈련하고 검증하였다.
  • C-반응성 단백질(CRP), D-다이머, 프로칼цит론틴 등의 개별 생물학적 마커의 예측 능력을 순위 매기기 위해 특징 중요도 분석을 실시하였다.
  • 정확도, 정밀도, ROC 곡선 아래 면적(AUC)과 같은 표준 지표를 사용하여 모델 성능을 평가하였다.
  • 동일한 데이터셋에 대해 다양한 알고리즘을 테스트함으로써 모델의 강건성을 확보하였으며, 다양한 방법에서 일관된 높은 성능을 확인하였다.
Figure 1: Proposed methodology and workflow of this research for machine learning analysis. [NCD = Non-Communicable Disease]
Figure 1: Proposed methodology and workflow of this research for machine learning analysis. [NCD = Non-Communicable Disease]

실험 결과

연구 질문

  • RQ1어느 정도의 정규 혈액 매개변수가 중증 코로나19 결과와 사망률과 가장 강하게 연관되어 있는가?
  • RQ2표준 임상 혈액 검사 자료를 기반으로 훈련된 기계학습 모델이 질병 중증도를 고정확도로 예측할 수 있는가?
  • RQ3동일한 임상 데이터셋을 사용할 때, 다양한 기계학습 알고리즘이 코로나19 중증도 예측에서 어떻게 비교되는가?
  • RQ4사용이 간편한 혈액 검사 기반 모델이 임상 환경에서 조기에 위험도 분류를 얼마나 향상시킬 수 있는가?
  • RQ5염증 및 응고 마커인 CRP, D-다이머, 페리틴의 질병 중증도 분류에 대한 예측 가치는 어느 정도인가?

주요 결과

  • 표준 혈액 검사 자료를 사용하여 질병 중증도 및 사망 결과 예측의 정확도와 정밀도가 모두 90% 이상을 초과하였다.
  • C-반응성 단백질(CRP)이 가장 예측 능력이 높은 생물학적 마커로 나타났으며, 그 다음으로 D-다이머, 프로칼цит론틴, 페리틴, 뇌 나트륨페프티드가 뒤이었다.
  • 헤모글로빈, 적혈구 침강속도, 혈소판 수치, 젖산 농도 역시 중증 환자에서 유의미한 변화를 보이며 예측 능력에 기여하였다.
  • 호흡수, 혈압(수축기 및 이완기), 헤마토크리트, 기저 초과(venous 및 arterial), 호산구 수치, 알부민, 요소 농도 역시 덜 두드러지지만 여전히 유의미한 변화와 예측 가치를 보였다.
  • 랜덤 포레스트, XGBoost, SVM 등 다양한 기계학습 알고리즘 간에 높은 성능의 일관성이 나타나 모델 선택에 대한 민감도가 낮고 강건함을 시사한다.
  • 이 연구는 자원이 제한된 의료 시스템에서 ICU 용량이 부족한 상황에서도 기존에 존재하는 저비용 병원 검사 자료를 활용해 고위험 환자를 조기에 식별할 수 있는 잠재력을 부각시킨다.
Figure 2: Association of blood parameters to be COVID-19 patients. Parameter measurements and significant difference (using t-test) for different blood parameters between the COVID-19 affected patients compared to the levels expected in regular patients blood parameters.
Figure 2: Association of blood parameters to be COVID-19 patients. Parameter measurements and significant difference (using t-test) for different blood parameters between the COVID-19 affected patients compared to the levels expected in regular patients blood parameters.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.