Skip to main content
QUICK REVIEW

[논문 리뷰] Comparison of hazard rate estimation in R

Yolanda Hagar, Vanja Dukić|arXiv (Cornell University)|2015. 09. 10.
Statistical Methods and Inference참고 문헌 30인용 수 7
한 줄 요약

이 논문은 오른쪽으로 잘린 생존 데이터에서 반-또는 비모수적 위험률 추정을 위한 여덟 개의 R 패키지를 평가하며, 정확도, 사용자 친화성, 비례 위험과 비비례 위험 조건 하에서의 성능을 중심으로 분석한다. 표준 모델에서는 bshazard() 함수가 가장 신뢰할 수 있고 사용자 친화적인 것으로 나타났으며, 비비례 위험 조건이 아닌 경우 timereg와 MRH 패키지가 뛰어난 성능을 보였고, 출력 형식이 명확하였다.

ABSTRACT

We give an overview of eight different software packages and functions available in R for semi- or non-parametric estimation of the hazard rate for right-censored survival data. Of particular interest is the accuracy of the estimation of the hazard rate in the presence of covariates, as well as the user-friendliness of the packages. In addition, we investigate the ability to incorporate covariates under both the proportional and the non-proportional hazards assumptions. We contrast the robustness, variability and precision of the functions through simulations, and then further compare differences between the functions by analyzing the "cancer" and "TRACE" survival data sets available in R, including covariates under the proportional and non-proportional hazards settings.

연구 동기 및 목표

  • 오른쪽으로 잘린 생존 데이터에서 비모수적 및 반모수적 위험률 추정을 위한 R 패키지의 정확도, 강건성, 정밀도를 평가하기 위해.
  • 비례 위험과 비비례 위험 가정 하에서 모두에서 공변량을 통합할 수 있는 패키지의 능력을 평가하기 위해.
  • 표준 R 공식 문법, print/plot/summary 기능과의 호환성, 문서화의 명확성에 기반한 사용자 친화성 비교를 위해.
  • 실제 생존 분석 응용에 가장 신뢰할 수 있고 실용적인 패키지를 특정하기 위해.
  • 메소드적 타당성과 구현 용이성의 균형을 고려해 연구자들이 적절한 R 패키지를 선택할 수 있도록 안내하기 위해.

제안 방법

  • 비례 위험과 비비례 위험 조건 하에서의 시뮬레이션 연구를 수행하여, 다양한 패키지 간의 추정 정확도, 변동성, 정밀도를 비교하였다.
  • R에서 제공하는 'cancer' 및 'TRACE' 생존 데이터셋을 활용해 실제 설정에서의 성능을 평가하였다.
  • 표준 R 생존 모델링 관례 준수 여부를 기준으로 패키지를 평가하였으며, Surv() 및 formula() 문법과 표준 R 출력 기능과의 호환성도 고려했다.
  • 다양한 데이터 조건과 모델 가정 하에서 패키지가 신뢰할 수 있는 위험률 추정치와 공변량 효과 추정치를 제공하는지 평가하였다.
  • 문서화 품질, 예제의 명확성, 모델 피팅, 플롯, 결과 요약의 용이성에 기반해 사용자 친화성을 평가하였다.
  • 빈도주의와 베이지안 접근 방식을 모두 포함하여, 계산 효율성과 MCMC 요구 사항에 주의를 기울였다.

실험 결과

연구 질문

  • RQ1오른쪽으로 잘린 데이터가 존재하는 상황에서 어떤 R 패키지가 위험률 추정치를 가장 정확하고 정밀하게 제공하는가?
  • RQ2다른 패키지들은 비례 위험과 비비례 위험 가정 하에서 공변량 효과를 얼마나 잘 다루는가?
  • RQ3표준 R 워크플로우에서 메소드적 강건성과 사용자 친화성의 가장 좋은 균형을 제공하는 패키지는 무엇인가?
  • RQ4평가된 패키지들 간에 계산 속도와 구현 복잡도는 어떻게 다름이 있는가?
  • RQ5패키지 간 출력 해석과 모델 진단에서의 주요 차이는 무엇인가?

주요 결과

  • 충분한 실패 관측이 있는 단순 생존 모델에서는 bshazard() 함수가 가장 안정적이고 정확한 위험률 추정치를 제공하였다.
  • bshazard() 함수는 매우 사용자 친화적이었으며, 표준 R 공식 문법을 지원하고 print(), plot(), summary() 기능과 호환되었다.
  • 비비례 위험 조건이 아닌 경우, timereg와 MRH 패키지는 특히 사용자 친화적이며 강건한 것으로 나타났으며, estimateMRH() 함수는 더 전통적이고 해석 가능한 공변량 효과 보고 방식을 제공하였다.
  • timecox() 함수는 MCMC 기반 대안보다 더 빠른 계산을 제공했으며, 마르코프 체인 몬테카를로 샘플링이 필요로 하지 않아 전통적인 유의성 검정이 가능하였다.
  • LDDPsurvival() 함수는 신뢰할 수 있었지만, 부실한 문서화와 특이한 함수 설계로 인해 큰 모델에서는 사용이 어려웠다.
  • bayesSurv, BGPhazard, DPpackage와 같은 베이지안 패키지는 고급 모델링 기능을 제공했지만, MCMC와 사전 분포에 대한 깊은 이해가 필요해 학습 곡선이 높았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.