[논문 리뷰] Enhancing Prediction Models for One-Year Mortality in Patients with Acute Myocardial Infarction and Post Myocardial Infarction Syndrome
이 연구는 MIMIC-III 데이터베이스의 구조화된 EHR 데이터와 자유형 퇴원 요약문에서 추출한 워드 임베딩 특징을 융합하여 급성 심장마비(AMI) 및 AMI 후 증후군 환자의 1년 생존율 예측을 위한 딥러닝 모델을 향상시켰다. 비구조화된 텍스트 특징의 융합은 모델 성능을 크게 향상시켜 평균 정확도 92.89%와 F-measure 0.928를 달성하였다.
Predicting the risk of mortality for patients with acute myocardial infarction (AMI) using electronic health records (EHRs) data can help identify risky patients who might need more tailored care. In our previous work, we built computational models to predict one-year mortality of patients admitted to an intensive care unit (ICU) with AMI or post myocardial infarction syndrome. Our prior work only used the structured clinical data from MIMIC-III, a publicly available ICU clinical database. In this study, we enhanced our work by adding the word embedding features from free-text discharge summaries. Using a richer set of features resulted in significant improvement in the performance of our deep learning models. The average accuracy of our deep learning models was 92.89% and the average F-measure was 0.928. We further reported the impact of different combinations of features extracted from structured and/or unstructured data on the performance of the deep learning models.
연구 동기 및 목표
- 고급 기계학습 모델을 사용하여 AMI 및 AMI 후 증후군 환자의 1년 생존율 예측 정확도를 향상시키기 위해.
- 자연어 처리 기법을 활용하여 퇴원 요약문의 비구조화된 임상 텍스트를 기존 예측 모델에 통합하기 위해.
- 구조화된 EHR 데이터와 자유형 텍스트 특징을 융합함으로써 모델 성능에 미치는 영향을 평가하기 위해.
- 중증 치료 위험 분류를 최적화하기 위해 예측 성능을 극대화하는 최적의 특징 조합을 규명하기 위해.
제안 방법
- MIMIC-III 데이터베이스의 구조화된 임상 데이터를 기반으로 훈련된 딥러닝 모델을 사용하였다.
- 자연어 처리 기법을 활용하여 자유형 퇴원 요약문에서 워드 임베딩을 추출하였다.
- 생체 징후, 검사 결과 등의 구조화된 특징과 임상 텍스트의 분포 표현을 융합하였다.
- 하이브리드 특징 세트를 사용하여 다양한 딥러닝 아키텍처를 훈련하고 평가하였다.
- 다양한 특징 조합에 대해 모델 성능을 평가하기 위해 교차 검증을 사용하였다.
- 모델 초모수를 최적화하고 표준 평가 지표인 정확도와 F-measure를 사용하여 평가하였다.
실험 결과
연구 질문
- RQ1임상 퇴원 요약문의 워드 임베딩을 통합할 경우 AMI 환자에서 생존율 예측 모델의 성능에 어떤 영향을 미치는가?
- RQ2구조화된 EHR 데이터와 비구조화된 텍스트 특징 중 어느 것이 1년 생존율 예측에 더 큰 기여를 하는가?
- RQ3구조화된 특징과 비구조화된 특징의 어떤 조합이 가장 높은 예측 정확도를 제공하는가?
- RQ4다중모달 EHR 데이터를 기반으로 훈련된 딥러닝 모델은 생존율 위험 분류를 상당히 향상시킬 수 있는가?
주요 결과
- 퇴원 요약문의 워드 임베딩을 구조화된 EHR 데이터와 융합함으로써 모델 성능이 상당히 향상되었다.
- 성능이 가장 뛰어난 모델은 여러 시행에 걸쳐 평균 정확도 92.89%와 F-measure 0.928를 달성하였다.
- 구조화된 특징과 비구조화된 특징을 모두 사용한 모델는 구조화된 데이터에만 의존하는 모델보다 성능이 뛰어났다.
- 텍스트에서 유도된 임베딩의 기여도는 상당히 높았으며, 비구조화된 노트에 유의미한 임상 정보가 포함되어 있음을 시사했다.
- 특징 조합 분석 결과, 하이브리드 모델은 항상 단일 모odal 접근 방식보다 예측 능력이 뛰어났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.