[논문 리뷰] Two-phase analysis and study design for survival models with error-prone exposures
이 논문은 오차가 있는 노출 변수를 가진 이단계 생존 분석으로 평균 점수 방법을 확장하며, 검증되지 않은 공변량의 보조 데이터를 사용하여 측정 오차를 교정한다. 비용 제약 조건 하에 분산을 최소화함으로써 추정 효율성을 높이는 적응형 표본 설계를 제안하며, 시뮬레이션과 실제 데이터에서 거의 오라클 성능을 달성한다. 특히 최적의 피лот 표본 추출과 계층별 할당을 통해 뛰어난 성능을 발휘한다.
Increasingly, medical research is dependent on data collected for non-research purposes, such as electronic health records data (EHR). EHR data and other large databases can be prone to measurement error in key exposures, and unadjusted analyses of error-prone data can bias study results. Validating a subset of records is a cost-effective way of gaining information on the error structure, which in turn can be used to adjust analyses for this error and improve inference. We extend the mean score method for the two-phase analysis of discrete-time survival models, which uses the unvalidated covariates as auxiliary variables that act as surrogates for the unobserved true exposures. This method relies on a two-phase sampling design and an estimation approach that preserves the consistency of complete case regression parameter estimates in the validated subset, with increased precision leveraged from the auxiliary data. Furthermore, we develop optimal sampling strategies which minimize the variance of the mean score estimator for a target exposure under a fixed cost constraint. We consider the setting where an internal pilot is necessary for the optimal design so that the phase two sample is split into a pilot and an adaptive optimal sample. Through simulations and data example, we evaluate efficiency gains of the mean score estimator using the derived optimal validation design compared to balanced and simple random sampling for the phase two sample. We also empirically explore efficiency gains that the proposed discrete optimal design can provide for the Cox proportional hazards model in the setting of a continuous-time survival outcome.
연구 동기 및 목표
- 모든 환자에게 금표준 노출 데이터가 가용하지 않을 경우 생존 결과의 측정 오차를 다루기 위해.
- 이전에 이산 시간 생존 및 이진 결과에 사용된 평균 점수 방법을 오차가 있는 노출 변수를 가진 연속 시간 생존 모델로 확장하기 위해.
- 고정된 비용 제약 조건 하에 목표 회귀 파라미터의 분산을 최소화하는 최적의 이단계 표본 설계를 개발하기 위해.
- 목표 계층 할당을 위한 부수적 파라미터를 추정하기 위해 피лот 단계를 활용한 적응형 설계를 제안하기 위해.
- 제안된 설계의 효율성 향상을 단순 무작위 표본 및 균형 잡힌 표본과 비교하여 시뮬레이션 및 실제 데이터에서 평가하기 위해.
제안 방법
- 이단계 표본 설계를 사용: 제1단계에서는 모든 환자에게 쉽게 확보 가능한 오차가 있는 노출 데이터를 수집하고, 제2단계에서는 일부를 검증하여 오차 구조를 추정한다.
- 오차가 있는 노출 변수를 보조 변수로 사용하여 이산 시간 비례 위험 모델에서 회귀 파라미터 추정치를 교정하기 위해 평균 점수 방법을 적용한다.
- 고정된 검증 표본 크기 하에서 목표 파라미터의 분산을 최소화하는 방식으로 네이먼 할당을 통해 최적의 표본 비율을 유도한다.
- 다중 웨이브 표본 설계 전략을 도입: 피лот 단계에서 부수적 파rameter(예: 계층별 평균 및 분산)를 추정하여 주 단계에서 적응형 할당을 가능하게 한다.
- 피лот 데이터를 기반으로 표본 추출을 조정하는 수정된 적응형 설계를 활용하여, 균형 잡힌 표본 또는 단순 무작위 표본보다 성능을 향상시킨다.
- 코크스 비례 위험 모델을 사용하여 연속 시간 생존 분석으로 확장하며, 동일한 설계 프레임워크 하에서 효율성 향상을 입증한다.
실험 결과
연구 질문
- RQ1오차가 있는 노출 변수를 가진 이산 시간 생존 모델의 이단계 분석으로 평균 점수 방법을 효과적으로 확장할 수 있는가?
- RQ2고정된 비용 제약 조건 하에서 목표 회귀 파라미터의 분산을 최소화하기 위한 최적의 표본 비율을 어떻게 도출할 수 있는가?
- RQ3부수적 파rameter를 추정하기 위해 피лот 단계를 사용할 경우 적응형 표본 설계의 효율성에 어떤 영향을 미치는가?
- RQ4제안된 적응형 설계는 단순 무작위 표본 및 균형 잡힌 표본과 비교하여 분산 감소 및 추정 효율성 측면에서 어떻게 다른가?
- RQ5유도된 최적 설계는 코크스 모델을 사용한 연속 시간 생존 분석에서 얼마나 효율성을 향상시킬 수 있는가?
주요 결과
- 국립 윌름스 퇴행성 종양 연구 데이터에서 제안된 평균 점수 추정기와 적응형 표본 설계는 균형 잡힌 표본 및 단순 무작위 표본 대비 최대 14%의 분산 감소를 달성하였다.
- 피лот 단계를 포함한 적응형 설계는 진정한 모집단 파라미터를 사용하는 오라클 설계의 성능을 거의 완벽하게 재현하였으며, 특히 정보가 적은 계층을 과도하게 샘플링하지 않도록 전략적으로 피лот 표본을 선택한 경우에 특히 뛰어난 성능을 보였다.
- 이전 분석에서 제외된 간헐적 케이서링 환자(n = 158)를 포함함으로써 정밀도가 향상되었으며, 특히 MS-BAL 및 MS-A 추정기에서 두드러진 향상이 관찰되었다.
- 제2단계 표본 크기가 증가할수록 완전 케이스 분석 및 기타 표본 추출 전략에 비해 일관된 효율성 향상이 관찰되었다.
- 모든 시뮬레이션 설정 및 데이터 예제에서 단순 무작위 표본 및 균형 잡힌 표본보다 적응형 설계가 뛰어난 성능을 보이며, 강건성과 실용적 유용성을 입증하였다.
- 코크스 모델을 사용하여 연속 시간 생존 결과로의 확장도 성공적으로 수행되었으며, 유형 I 및 무작위 오른쪽 케이서닝 조건 하에서 모두 효율성 향상이 관찰되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.