Skip to main content
QUICK REVIEW

[논문 리뷰] Surrogate Assisted Semi-supervised Inference for High Dimensional Risk Prediction

Jue Hou, Zijian Guo|PubMed|2021. 05. 04.
Genetic Associations and Epidemiology참고 문헌 39인용 수 5
한 줄 요약

이 논문은 예측 변수와 결과의 대체 지표(서로가)를 포함한 대규모 비라벨 데이터셋과 진짜 결과가 포함된 소규모 라벨 데이터셋을 사용하여 고차원 위험 예측을 위한 서로서티드 보조 반감독 학습(SAS) 방법을 제안한다. 밀도 있는 위험 모델과 모델 잘못 지정 상황에서도 유효한 추론이 가능하도록, 희소 보정 모델에서 모멘트 조건과 일단계 보정을 결합함으로써, 시뮬레이션과 당뇨병 유전 위험 예측의 실제 사례에서 뛰어난 성능을 보였다.

ABSTRACT

Risk modeling with electronic health records (EHR) data is challenging due to no direct observations of the disease outcome and the high-dimensional predictors. In this paper, we develop a surrogate assisted semi-supervised learning approach, leveraging small labeled data with annotated outcomes and extensive unlabeled data of outcome surrogates and high-dimensional predictors. We propose to impute the unobserved outcomes by constructing a sparse imputation model with outcome surrogates and high-dimensional predictors. We further conduct a one-step bias correction to enable interval estimation for the risk prediction. Our inference procedure is valid even if both the imputation and risk prediction models are misspecified. Our novel way of ultilizing unlabelled data enables the high-dimensional statistical inference for the challenging setting with a dense risk prediction model. We present an extensive simulation study to demonstrate the superiority of our approach compared to existing supervised methods. We apply the method to genetic risk prediction of type-2 diabetes mellitus using an EHR biobank cohort.

연구 동기 및 목표

  • 진짜 질병 결과가 관찰되지 않으며 비용이 많이 들기 때문에 전자 건강 기록(EHR)에서 고차원 위험 예측 문제를 해결하기 위한 것이다.
  • 예측 변수와 결과 대체 지표가 포함된 비라벨 데이터와 진짜 결과가 포함된 소규모 라벨 데이터를 활용하는 반감독 학습 프레임워크를 개발하기 위한 것이다.
  • 기본 위험 모델이 밀도가 높거나 잘못 지정된 경우에도 위험 예측에 대한 유효한 통계적 추론을 보장하기 위한 것이다.
  • EHR 생물은행 데이터를 활용하여 복잡한 질환인 제2형 당뇨병의 유전 위험 예측 정확도와 강건성을 향상시키기 위한 것이다.

제안 방법

  • SAS 방법은 대규모 비라벨 데이터셋에서 대체 지표와 예측 변수를 사용하여 관측되지 않은 진짜 결과를 추정하기 위해 희소 작업 보정 모델을 사용한다.
  • 보정 모델 잘못 지정에 대비한 강건성을 확보하기 위해 모멘트 조건을 통합한다.
  • 예측된 위험에 대한 유효한 구간 추정을 가능하게 하기 위해 일단계 보정을 적용한다.
  • 예측 정확도 향상을 위해 대체 결과(예: ICD 코드 또는 NLP 언급)와 고차원 예측 변수를 결합한다.
  • 두 단계 추정 절차를 활용한다: 첫째, 대체 지표와 예측 변수를 사용하여 결측 결과를 보정한다; 둘째, 최종 위험 예측의 편향을 보정한다.
  • 고차원 설정 하에서 일致성과 추정된 위험 계수의 점근 정규성을 보장하는 이론적 보장 조건를 도출한다.

실험 결과

연구 질문

  • RQ1대체 지표가 포함된 대규모 비라벨 EHR 데이터를 효과적으로 활용하여 고차원 위험 예측을 향상시킬 수 있는 반감독 학습 접근법이 가능한가?
  • RQ2진짜 위험 모델이 밀도가 높거나 잘못 지정된 경우에도 유효한 통계적 추론을 유지할 수 있는가?
  • RQ3라벨 데이터만을 사용하는 지도 학습 방법과 비교했을 때 대체 지표를 통합함으로써 예측 정확도가 얼마나 향상되는가?
  • RQ4고차원 설정에서 위험 예측에 대한 신뢰구간 추정이 신뢰성 있게 수행될 수 있는가?
  • RQ5실제 복잡한 질환인 제2형 당뇨병의 유전 위험 예측에서 SAS 방법은 어떤 성능을 보이는가?

주요 결과

  • 기본 위험 모델이 밀도가 높고 작업 보정 모델이 잘못 지정된 경우에도 SAS 절차는 예측된 위험에 대해 유효한 추론을 제공한다.
  • 시뮬레이션 결과에서 SAS 방법은 기존 지도 학습 방법보다 예측 정확도와 신뢰구간 커버리지 측면에서 뛰어난 성능을 보였다.
  • 실제 EHR 데이터에서 ICD 코드의 경우 48%의 양성 예측도(PPV)와 NLP 언급의 경우 19%의 양성 예측도를 기록하여 대체 지표 보조 보정의 필요성을 입증했다.
  • 일단계 보정이 효과적으로 추정 편향을 감소시켜 고차원 위험 예측의 정확한 구간 추정을 가능하게 했다.
  • 모델 잘못 지정 및 고차원 설정에서 뛰어난 강건성을 보였으며, 이론적으로 일치성과 점근 정규성을 확립했다.
  • 생물은행 코hort에 적용한 결과, 기존 지도 학습 접근법에 비해 제2형 당뇨병의 유전 위험 예측 성능이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.