Skip to main content
QUICK REVIEW

[논문 리뷰] Survival analysis as a classification problem

Chenyang Zhong, Robert Tibshirani|arXiv (Cornell University)|2019. 09. 24.
Statistical Methods and Inference참고 문헌 6인용 수 4
한 줄 요약

이 논문은 생존 분석을 위한 스태킹 기반 분류 프레임워크를 제안하며, 각 비운제된 사건을 그 위험집합 내의 분류 과제로 간주함으로써 생존 데이터를 이元 분류 문제로 변환한다. 이 방법은 랜덤 포레스트, 기울기 부스팅, 신경망과 같은 다양한 기계학습 알고리즘의 사용을 가능하게 하여, 특히 복잡한 상호작용과 비선형 효과가 있는 상황에서 코크스 비례위험 모델에 비해 향상된 생존 곡선 추정을 가능하게 한다.

ABSTRACT

In this paper, we explore a method for treating survival analysis as a classification problem. The method uses a "stacking" idea that collects the features and outcomes of the survival data in a large data frame, and then treats it as a classification problem. In this framework, various statistical learning algorithms (including logistic regression, random forests, gradient boosting machines and neural networks) can be applied to estimate the parameters and make predictions. For stacking with logistic regression, we show that this approach is approximately equivalent to the Cox proportional hazards model with both theoretical analysis and simulation studies. For stacking with other machine learning algorithms, we show through simulation studies that our method can outperform Cox proportional hazards model in terms of estimated survival curves. This idea is not new, but we believe that it should be better known by statistiicians and other data scientists.

연구 동기 및 목표

  • 생존 분석과 기계학습을 연결하기 위해 생존 문제를 분류 과제로 재정의한다.
  • 다양한 분류 알고리즘을 생존 데이터에 적용할 수 있도록 스태킹 기반 프레임워크를 개발한다.
  • 스태킹을 통한 로지스틱 회귀가 코크스 비례위험 모델을 근사함을 보여준다.
  • 스태킹을 통한 고급 기계학습 알고리즘의 적용이 비선형 또는 상호작용이 많은 상황에서 생존 곡선 추정을 향상시킴을 보여준다.
  • 시간에 따라 변화하는 공변량으로의 확장을 수행하고 성능을 검증한다.

제안 방법

  • 모든 비운제된 사건의 위험집합을 스태킹하여 큰 데이터 프레임을 구성하며, 각 행은 실패 시점에 위험에 있는 주체를 나타낸다.
  • 동일한 위험집합 내에서 실패한 주체에 대해 1, 나머지 주체에 대해 0인 이元 반응 벡터를 정의한다.
  • 모든 주체의 공변량에서 예측자 행렬을 구성하며, 주체별 절편을 위한 추가 이원수 열을 포함한다.
  • 스태킹된 데이터에 대해 분류 알고리즘(로지스틱 회귀, 랜덤 포레스트, GBM, 신경망)을 적용하여 생존 확률을 추정한다.
  • 분류 모델에서 예측한 생존 곡선을 사용하여 개별 생존 함수를 추정한다.
  • 각 실패 시점 이전의 가장 최근 공변량 값을 사용하여 시간에 따라 변화하는 공변량으로 방법을 확장한다.

실험 결과

연구 질문

  • RQ1스태킹 프레임워크를 사용하여 생존 분석을 효과적으로 분류 문제로 재구성할 수 있는가?
  • RQ2로지스틱 회귀를 사용한 스태킹 방법이 추정 및 추론 측면에서 코크스 비례위험 모델과 비교하여 어떻게 되는가?
  • RQ3스태킹을 통해 적용된 기계학습 알고리즘이 비선형 또는 상호작용이 많은 상황에서 코크스 모델에 비해 생존 곡선 추정을 향상시키는가?
  • RQ4시간에 따라 변화하는 공변량이 있는 경우 스태킹 방법이 표준 코크스 회귀와 비교하여 어떻게 성능을 내는가?
  • RQ5Harrell의 C-index와 AUC 지표를 사용하여 다양한 스태킹 기반 모델의 예측 성능은 어떠한가?

주요 결과

  • 로지스틱 회귀를 사용한 스태킹은 이론적으로나 경험적으로나 코크스 비례위험 모델과 거의 동일한 추정 및 추론 결과를 산출한다.
  • 선형 효과가 있는 모델 1에서는 스태킹 로지스틱 회귀와 코크스 회귀가 동일한 AUC 값 0.743을 기록했다.
  • 비선형 및 상호작용 효과가 있는 모델 2에서는 GBM을 사용한 스태킹이 AUC 0.781을 기록하여 코크스 회귀(0.727)와 로지스틱 회귀(0.727)를 모두 앞섰다.
  • 랜덤 포레스트와 신경망은 성능이 혼합되었으며, 랜덤 포레스트는 AUC 0.686–0.691, 신경망은 모델 2에서 낮은 AUC(0.620–0.615)를 기록하여 모델 복잡도에 민감함을 보였다.
  • GBM과 신경망을 사용한 스태킹 방법은 복잡한 효과가 있는 시뮬레이션에서 코크스 모델보다 더 정확한 생존 곡선 추정을 제공했으며, 시각적 비교를 통해 이를 확인할 수 있었다.
  • 시간에 따라 변화하는 공변량으로의 확장은 코크스 회귀와 매우 유사한 계수 및 p-값 추정을 산출하여, 동적 공변량 설정에서의 일관성을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.