[논문 리뷰] An evaluation of randomized machine learning methods for redundant data: Predicting short and medium-term suicide risk from administrative records and risk assessments
이 연구는 정신건강 환자 7,399명의 행정 및 임상 데이터를 바탕으로 단기 및 중기 예측을 위한 랜덤화된 기계학습 방법—랜덤 포레스트, 그래디언트 부스팅 머신, 드롭아웃을 적용한 딥 네ural 네트워크—를 평가한다. 랜덤화된 방법들은 AUC 및 F1 스코어에서 임상의보다 뛰어나며, 데이터 중복성에 강건하고 예측 정확도가 뛰어나다.
Accurate prediction of suicide risk in mental health patients remains an open problem. Existing methods including clinician judgments have acceptable sensitivity, but yield many false positives. Exploiting administrative data has a great potential, but the data has high dimensionality and redundancies in the recording processes. We investigate the efficacy of three most effective randomized machine learning techniques random forests, gradient boosting machines, and deep neural nets with dropout in predicting suicide risk. Using a cohort of mental health patients from a regional Australian hospital, we compare the predictive performance with popular traditional approaches clinician judgments based on a checklist, sparse logistic regression and decision trees. The randomized methods demonstrated robustness against data redundancies and superior predictive performance on AUC and F-measure.
연구 동기 및 목표
- 고차원성과 중복성이 높은 행정 및 임상 데이터를 활용해 정신건강 환자에서 자살 위험을 예측하는 데 도전하는 것.
- 랜덤화된 기계학습 기법이 전통적 방법과 임상가 평가에 비해 예측 성능을 향상시킬 수 있는지 평가하는 것.
- 전자의료기록에서 흔한 데이터 중복성에 대해 랜덤화된 모델의 강건성을 조사하는 것.
- 희소 로지스틱 회귀, 결정 트리, 임상가 체크리스트와 비교하여 랜덤 포레스트, 그래디언트 부스팅 머신, 드롭아웃을 적용한 딥 네URAL 네트워크의 예측 성능을 비교하는 것.
- 다양한 예측 수평선(15일에서 360일)에 걸쳐 이러한 방법의 효과성을 검증하는 것.
제안 방법
- 25개의 트리를 사용한 랜덤 포레스트, 분할당 √p개의 특성 샘플링, 잎 노드 최소 크기 n/64.
- 약한 학습기 200개를 사용한 그래디언트 부스팅 머신, 50% 데이터 샘플링, 최대(p/3, √n) 크기의 무작위 특성 조합, 동적 학습률.
- 각각 50개의 뉴런을 가진 두 개의 은닉층을 사용한 딥 네URAL 네트워크, 미니배치 크기 64인 확률적 경사하강법, 적응형 학습률 감쇠.
- 다양한 정규화 기법 통합: 가중치 감쇠(10⁻⁴), 최대 노름 제약(값 1), 은닉층 및 입력 특성에 대해 드롭아웃 비율 0.5 적용.
- 학습 중 드롭아웃을 적용해 랜덤하게 단위 비활성화(확률 0.5), 추론 시 드롭아웃 비율에 따라 가중치 스케일링하여 모델 앙상블 근사.
- 유사한 전자 건강기록 시스템 간 일반화를 보장하기 위해 EMR 유래 예측 변수 표준화.
실험 결과
연구 질문
- RQ1랜덤화된 기계학습 방법은 임상가 평가 및 전통적 통계 모델에 비해 자살 위험 예측 정확도를 향상시킬 수 있는가?
- RQ2랜덤 포레스트, 그래디언트 부스팅 머신, 드롭아웃을 적용한 딥 네URAL 네트워크는 중복성 있고 고차원적인 정신건강 데이터에서 AUC 및 F1 스코어 측면에서 어떻게 성능을 내는가?
- RQ3이러한 랜덤화된 모델은 전자의료기록에서 흔한 데이터 중복성과 고차원성에 대해 어느 정도 강건한가?
- RQ4입력층 및 은닉층 수준에서 드롭아웃을 통합함으로써 일반화 능력 향상과 과적합 감소가 자살 위험 예측에 기여하는가?
- RQ5제안된 모델의 예측 성능은 15일에서 360일까지 다양한 예측 수평선에서 어떻게 변화하는가?
주요 결과
- 랜덤화된 기계학습 방법은 18점 체크리스트를 사용한 임상가보다 유의미하게 높은 AUC 및 F1 스코어를 달성했다.
- 랜덤 포레스트, 그래디언트 부스팅 머신, 드롭아웃을 적용한 딥 네URAL 네트워크는 모든 예측 수평선에서 희소 로지스틱 회귀 및 결정 트리보다 AUC 및 F1 측정치에서 뛰어난 성능을 보였다.
- 드롭아웃을 적용한 딥 네URAL 네트워크는 특성 및 은닉 뉴런 수준에서의 정규화로 인해 뛰어난 성능을 보였다.
- 모델들은 데이터 중복성에 강건했으며, 라소 기반 방법과 달리 특성 제거 없이도 유용한 정보를 유지했다.
- 15일에서 360일까지 모든 수평선에서 성능이 안정적이었으며, 랜덤화된 모델의 우월성이 일관되게 유지되었다.
- EMR 데이터의 중복된 특성 영향을 완화하기 위해 입력층에서의 드롭아웃 사용이 핵심이었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.