Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Learning for Quantile Regression under Right Censoring: DeepQuantreg

Yichen Jia, Jong‐Hyeon Jeong|arXiv (Cornell University)|2020. 07. 14.
Statistical Methods and Inference인용 수 5
한 줄 요약

이 논문은 우측 근거 생존 데이터에서 양자수축 회귀를 위한 딥러닝 프레임워크인 DeepQuantreg를 제안한다. 이는 근거를 다루기 위해 역확률가중치와 함께 허버 확인 함수를 사용한다. 이 방법은 기존의 선형 및 비모수적 양자수축 회귀보다 비선형 생존 패턴 예측에서 더 뛰어난 정확도와 안정성을 보이며, 시뮬레이션 및 유전자 서열이 포함된 실제 유방암 데이터셋에서 다수의 양자수축에서 성능이 뛰어나다.

ABSTRACT

The computational prediction algorithm of neural network, or deep learning, has drawn much attention recently in statistics as well as in image recognition and natural language processing. Particularly in statistical application for censored survival data, the loss function used for optimization has been mainly based on the partial likelihood from Cox's model and its variations to utilize existing neural network library such as Keras, which was built upon the open source library of TensorFlow. This paper presents a novel application of the neural network to the quantile regression for survival data with right censoring, which is adjusted by the inverse of the estimated censoring distribution in the check function. The main purpose of this work is to show that the deep learning method could be flexible enough to predict nonlinear patterns more accurately compared to existing quantile regression methods such as traditional linear quantile regression and nonparametric quantile regression with total variation regularization, emphasizing practicality of the method for censored survival data. Simulation studies were performed to generate nonlinear censored survival data and compare the deep learning method with existing quantile regression methods in terms of prediction accuracy. The proposed method is illustrated with two publicly available breast cancer data sets with gene signatures. The method has been built into a package and is freely available at \url{https://github.com/yicjia/DeepQuantreg}.

연구 동기 및 목표

  • 우측 근거 생존 데이터에서 비선형 관계를 다루기 어려운 기존 방법들에 비해 더 유연한 딥러닝 기반의 양자수축 회귀 방법을 개발하는 것.
  • 허버 확인 함수를 사용하여 근거 생존 데이터의 근거를 다루기 위해 역확률가중치(IPCW)를 손실 함수에 통합하는 것.
  • 특히 시간-사건 데이터에서 비선형 패턴을 잘 포착할 수 있도록 기존 선형 및 비모수적 양자수축 회귀 방법보다 정확도를 향상시키는 것.
  • Keras 및 텐서플로우 2.0을 통한 실용적이고 오픈소스 구현을 제공하여 GPU 가속 기능과 예측 구간을 지원하는 것.

제안 방법

  • 이 방법은 우측 근거 하에서 양자수축 회귀를 최적화하기 위해 수정된 허버 확인 함수를 손실 함수로 사용하는 신경망을 활용한다.
  • 근거는 추정된 생존 분포에서 유도된 역확률가중치(IPCW)를 통해 조정되며, 근거 관측치의 편향을 보정한다.
  • 완전히 연결된 피드포워드 네트워크 아키텍처를 사용하며, 다수의 은닉층과 뉴런을 포함하고, 각 학습 폴드에서 하이퍼파라미터 튜닝을 수행한다.
  • 오버피팅을 방지하기 위해 드롭아웃 및 L2 펜alties와 같은 정규화 기법을 통합하였으며, Keras/TensorFlow 2.0를 통해 GPU 학습을 지원한다.
  • 예측 구간은 훈련된 네트워크에서 특정 양자수축에 해당하는 출력을 사용하여 생성되며, 확률적 예측 가능성을 제공한다.
  • 모델은 적응형 학습률을 사용하는 확률적 경사 하강법으로 훈련되며, C-index, MMSE 및 양자수축 손실을 사용하여 성능을 평가한다.

실험 결과

연구 질문

  • RQ1딥러닝 모델은 우측 근거 하에서 시간-사건 데이터의 비선형 관계를 효과적으로 포착할 수 있는가? 기존의 선형 및 비모수적 양자수축 회귀보다 성능이 뛰어나다 할 수 있는가?
  • RQ2허버 확인 함수에 역확률가중치를 포함함으로써 근거 양자수축 회귀의 추정 정확도는 어떻게 향상되는가?
  • RQ3은닉층 수와 뉴런 수(네트워크의 깊이 및 너비)는 근거 생존 데이터에서 예측 성능에 어떤 영향을 미치는가?
  • RQ4기존 방법과 비교하여 제안된 방법은 유전자 발현 및 임상 공변량을 포함한 실제 유방암 데이터셋에서 어떻게 성능을 발휘하는가?

주요 결과

  • NKI70 데이터셋(n=144)에서 DeepQuantreg는 25번째, 50번째, 75번째 양자수축 모두에서 안정적인 성능을 유지했으며, 기존 방법들은 높은 양자수축에서 성능이 저하되었다. τ=0.75일 때 C-index는 0.734였다.
  • METABRIC 데이터셋(n=1884)에서 DeepQuantreg는 Quantreg 및 rqss 모두를 압도적으로 뛰어넘었으며, 모든 평가 지표에서 뛰어난 성능을 보였다: τ=0.25일 때 C-index는 0.657, τ=0.75일 때 MMSE는 0.780, τ=0.75일 때 양자수축 손실은 0.342였다.
  • NKI70 데이터에서 DeepQuantreg는 τ=0.75일 때 가장 낮은 양자수축 손실(0.168)을 기록하여, 비선형성이 더 두드러지는 높은 양자수축에서 더 뛰어난 예측 정확도를 보였다.
  • 작은 또는 중간 크기의 표본 크기와 저차원 공변량 조건에서도 강건성을 보였으며, 반복적인 2/3 훈련 및 1/3 테스트 분할에서도 일관된 성능을 유지했다.
  • 드롭아웃 및 L2 정규화의 포함으로 일반화 성능이 향상되었으며, Google Colab를 통한 GPU 지원으로 학습 시간이 크게 단축되었다.
  • 모델이 생성한 예측 구간은 관측된 양자수축 성능와 일관되며 신뢰할 수 있었고, 임상적 해석 가능성까지 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.