[논문 리뷰] Detection of Risk Predictors of COVID-19 Mortality with Classifier Machine Learning Models Operated with Routine Laboratory Biomarkers
이 연구는 2,597명의 코로나19 환자에서 수집한 정규 혈액 생물표지자에 대해 히스토그램 기반 그래디언트 부스팅(HGB) 기계학습 모델을 적용하여 사망 예측 요인을 규명하였다. HGB 모델은 프로칼цит론과 D-다이머, ESR, D-빌리루빈 또는 페리틴을 이원 조합으로 사용할 경우 거의 완벽한 분류 성능(F1² > 0.98)을 달성하였으며, 단일 특징으로는 프로칼цит론(F1² = 0.96)과 페리틴(F1² = 0.91)이 상위 순서를 차지하였다. 또한, 치명적 위험도를 나타내는 임계 기준을 규명하였으며, 프로칼цит론은 0.2–5.2 μg/L, 페리틴은 376.2–396.0 μg/L로 확인되었다.
Early evaluation of patients who require special care and who have high death-expectancy in COVID-19, and the effective determination of relevant biomarkers on large sample-groups are important to reduce mortality. This study aimed to reveal the routine blood-value predictors of COVID-19 mortality and to determine the lethal-risk levels of these predictors during the disease process. The dataset of the study consists of 38 routine blood-values of 2597 patients who died (n = 233) and those who recovered (n = 2364) from COVID-19 in August-December, 2021. In this study, the histogram-based gradient-boosting (HGB) model was the most successful machine-learning classifier in detecting living and deceased COVID-19 patients (with squared F1 metrics F1^2 = 1). The most efficient binary combinations with procalcitonin were obtained with D-dimer, ESR, D-Bil and ferritin. The HGB model operated with these feature pairs correctly detected almost all of the patients who survived and those who died (precision > 0.98, recall > 0.98, F1^2 > 0.98). Furthermore, in the HGB model operated with a single feature, the most efficient features were procalcitonin (F1^2 = 0.96) and ferritin (F1^2 = 0.91). In addition, according to the two-threshold approach, ferritin values between 376.2 mkg/L and 396.0 mkg/L (F1^2 = 0.91) and pro-calcitonin values between 0.2 mkg/L and 5.2 mkg/L (F1^2 = 0.95) were found to be fatal risk levels for COVID-19. Considering all the results, we suggest that many features combined with these features, especially procalcitonin and ferritin, operated with the HGB model, can be used to achieve very successful results in the classification of those who live, and those who die from COVID-19. Moreover, we strongly recommend that clinicians consider the critical levels we have found for procalcitonin and ferritin properties, to reduce the lethality of the COVID-19 disease.
연구 동기 및 목표
- 기계학습을 활용해 정규 혈액 생물표지자 중 코로나19 사망 예측에 기여하는 요소를 규명하기 위해.
- 입원한 코로나19 환자에서 생존자와 사망자를 분류하기 위한 최적의 특징 조합을 규명하기 위해.
- 질병 진행 중 치명적 위험을 경고하는 핵심 생물표지자의 임계 수준을 설정하기 위해.
- 표준 혈액 검사 자료를 활용해 다양한 분류기 모델의 성능을 평가하여 생존자와 사망자를 구분하는 능력을 분석하기 위해.
- 조기 위험 분류를 지원하고 사망률을 감소시키기 위한 임상적으로 활용 가능한 생물표지자 기준을 제공하기 위해.
제안 방법
- 불균형 데이터에서 높은 성능를 보이는 히스토그램 기반 그래디언트 부스팅(HGB)을 주된 기계학습 분류기로 적용하였다.
- 2021년 8월~12월 기간 동안 2,597명의 환자로부터 수집한 38종의 정규 혈액 생물표지자(프로칼цит론, 페리틴, D-다이머, ESR, 빌리루빈 포함)를 사용하였다.
- 분류 정확도 평가를 위해 F1² 점수, 정밀도, 재현율 및 ROC 곡선 아래 면적(AUC)을 사용하였다.
- 임상적으로 유의미한 생물표지자 범위를 규명하기 위해 이중 기준 접근법을 적용하였다.
- 단일 특징 및 이원 조합 모델을 비교하여 최적의 예측 조합과 최고 성능를 보인 단일 특징을 도출하였다.
- 10겹 교차검증을 통해 결과를 검증하고, 데이터셋 전반에 걸쳐 모델의 일반화 능력에 대한 신뢰도를 보고하였다.
실험 결과
연구 질문
- RQ1기계학습 모델을 활용할 경우, 정규 혈액 생물표지자 중 코로나19 사망 예측에 가장 예측력이 높은 것은 무엇인가?
- RQ2코로나19 환자에서 생존자와 사망자를 분류하는 데 있어 분류 정확도를 극대화하는 두 생물표지자의 최적 조합은 무엇인가?
- RQ3HGB 모델을 사용할 경우, 단일 생물표지자 중 사망 예측에 가장 높은 F1² 점수를 기록하는 것은 무엇인가?
- RQ4프로칼цит론과 페리틴의 임계 기준 범위는 사망 위험 증가와 관련이 있으며, 그 범위는 무엇인가?
- RQ5표준 혈액 검사 자료를 활용한 기계학습 모델은 질병 초기 단계에서 고위험군과 저위험군을 신뢰성 있게 구분할 수 있는가?
주요 결과
- HGB 모델은 프로칼цит론과 D-다이머, ESR, D-빌리루빈 또는 페리틴의 이원 조합을 사용할 경우 F1² = 1.0의 최고 성능를 기록하였다.
- 프로칼цит론 단독으로는 F1² 점수가 0.96을 기록하여 사망 예측에 가장 효과적인 단일 생물표지자로 확인되었다.
- 페리틴 단독으로는 F1² 점수가 0.91을 기록하여 치명적 결과 예측에 강력한 예측력을 지닌 것으로 나타났다.
- 이중 기준 접근법을 통해 프로칼цит론 수치가 0.2–5.2 μg/L 사이일 경우 F1² = 0.95로 높은 위험 범위로 규명되었다.
- 페리틴 수치가 376.2–396.0 μg/L 사이일 경우 F1² = 0.91로 치명적 위험 기준으로 확인되었으며, 이는 임상적으로 중요한 기준으로 작용한다.
- 최적의 특징 조합을 사용한 HGB 모델은 정밀도 > 0.98, 재현율 > 0.98, F1² > 0.98의 성능를 기록하여 생존자와 사망자를 거의 완벽하게 분류하는 데 성공하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.