Skip to main content
QUICK REVIEW

[논문 리뷰] BigSurvSGD: Big Survival Data Analysis via Stochastic Gradient Descent

Aliasghar Tarkhan, Noah Simon|arXiv (Cornell University)|2020. 02. 28.
Stochastic Gradient Optimization Techniques참고 문헌 42인용 수 5
한 줄 요약

이 논문은 대규모 생존 데이터에서 코ックス 비례 위험 모델을 피팅하기 위한 새로운 확률적 경사 하강법 프레임워크인 BigSurvSGD를 제안한다. 부분 우도를 분리된 목표 함수로 재구성함으로써, 특히 대규모 또는 스트리밍 데이터 세트에 대해 효율적이고 안정적이며 확장 가능한 최적화를 가능하게 하며, 기존 코克斯 회귀와 통계적으로 동일하며 신경망과 같은 복잡한 모델을 지원한다.

ABSTRACT

In many biomedical applications, outcome is measured as a ``time-to-event'' (eg. disease progression or death). To assess the connection between features of a patient and this outcome, it is common to assume a proportional hazards model, and fit a proportional hazards regression (or Cox regression). To fit this model, a log-concave objective function known as the ``partial likelihood'' is maximized. For moderate-sized datasets, an efficient Newton-Raphson algorithm that leverages the structure of the objective can be employed. However, in large datasets this approach has two issues: 1) The computational tricks that leverage structure can also lead to computational instability; 2) The objective does not naturally decouple: Thus, if the dataset does not fit in memory, the model can be very computationally expensive to fit. This additionally means that the objective is not directly amenable to stochastic gradient-based optimization methods. To overcome these issues, we propose a simple, new framing of proportional hazards regression: This results in an objective function that is amenable to stochastic gradient descent. We show that this simple modification allows us to efficiently fit survival models with very large datasets. This also facilitates training complex, eg. neural-network-based, models with survival data.

연구 동기 및 목표

  • 대규모 생물의학 데이터 세트에서 전통적인 코ックス 비례 위험 모델의 계산적 불안정성과 메모리 제약을 해결한다.
  • 비분리된 구조로 인해 표준 부분 우도가 확률적 경사 최적화와 호환되지 않는 문제를 해결한다.
  • 시간-이벤트 데이터에서 신경망을 포함한 복잡한 모델의 효율적 훈련을 가능하게 한다.
  • 메모리에 올릴 수 없을 정도로 큰 데이터 세트에 대해 확장 가능하면서도 기존 코ックス 회귀와 통계적으로 동일한 결과를 유지하는 프레임워크를 제공한다.
  • 실시간 또는 대규모 생존 분석 응용을 위한 스트리밍 및 비스트리밍 구현을 모두 지원한다.

제안 방법

  • 코ックス 부분 우도를 관측치의 부분집합에 대해 분리된 목표 함수로 재구성하여 확률적 경사 하강법을 가능하게 한다.
  • U통계량 기반의 공식을 사용해 일致하고 미분 가능한 목표 함수를 유도하여 미니배치 최적화에 적합하게 한다.
  • 학습률 스케줄 $ \gamma_m = C / \sqrt{m} $ 를 사용한 적응형 확률적 경사 하강법(예: AMSGrad)을 구현한다.
  • 효율적 계산과 분산 감소를 위해 크기 $ S $ 의 계층 기반 샘플링을 도입한다.
  • 점근적으로 타당한 신뢰구간을 제공하기 위해 플러그인 및 비모수 부트스트랩 방법을 제안한다.
  • 실제 적용에서 수렴성과 안정성을 향상시키기 위해 반복값의 평균화(AveAMSGrad)를 적용한다.

실험 결과

연구 질문

  • RQ1코ックス 비례 위험 모델의 회귀에 대해 확률적 경사 하강법에 적합한 수정된 목표 함수를 설계할 수 있는가?
  • RQ2제안된 방법이 모델 가정 하에 기존 코ックス 회귀와 통계적으로 동일한 결과를 유지하는가?
  • RQ3완전한 데이터 최적화가 불가능한 환경에서 대용량 데이터 및 스트리밍 환경에 효과적으로 확장 가능한가?
  • RQ4빅서비SGD의 성능이 콘cordance 지수와 계수 추정치 측면에서 표준 coxph()와 비교해 어떻게 되는가?
  • RQ5확률적 최적화를 통해 생존 분석에서 신경망과 같은 복잡한 모델을 지원할 수 있는가?

주요 결과

  • FLCHAIN 데이터셋에서 BigSurvSGD는 coxph()와 모든 공변수에 대해 거의 동일한 위험비 추정치를 도출했으며, 95% 신뢰구간의 절대 너비 차이가 0.01 이내였다.
  • 스트라타 크기 $ S=2 $ 일 때 BigSurvSGD의 콘cordance 지수는 0.794로, coxph()의 0.792를 略로 뛰어넘었으며, 최신 기법과도 유사한 성능을 보였다.
  • VETERAN 및 GBSG 데이터셋에서 BigSurvSGD는 coxph()와 유사한 콘cordance 지수를 달성했으며, 더 작은 스트라타 크기를 사용할 경우 최대 0.006 향상되었다.
  • 플러그인 및 부트스트랩 방법을 통한 표준오차 추정에서 결과가 매우 유사했으며, 모든 공변수에서 95% 신뢰구간의 차이가 0.01 이내였다.
  • 스트라타 크기가 감소할수록 BigSurvSGD의 성능이 효과적으로 향상되었으며, 더 작은 $ S $ 는 시간-이벤트 데이터에서 쌍별 순서 일致성을 더 잘 포착함으로써 콘cordance 지수 향상에 기여했다.
  • BigSurvSGD는 목표 함수를 확률적 최적화에 적합하게 만들었기 때문에 신경망 기반 생존 모델의 훈련을 성공적으로 가능하게 하였으며, 이는 기존 코ックス 회귀에서는 존재하지 않는 능력이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.