Skip to main content
QUICK REVIEW

[논문 리뷰] Semi-supervised Triply Robust Inductive Transfer Learning

Tianxi Cai, Mengyan Li|arXiv (Cornell University)|2022. 09. 12.
Cancer-related molecular mechanisms research인용 수 4
한 줄 요약

이 논문은 고차원적 공변량 이동 조건 하에서 라벨이 부여된 소스 인구 집단의 데이터와 라벨이 없는 타겟 인구 집단의 데이터를 통합함으로써 저소비된 인구 집단에서의 예측 정확도를 향상시키는, 반감독형이며 삼중으로 강건한 유도 전이 학습 방법인 STRIFLE를 제안한다. 밀도 비율 모형과 보정 모형을 결합함으로써, 두 불필요 모형이 잘못 지정된 경우에도 강건성을 확보하여, 오차가 무시할 만큼 작고 타겟 전용 반감독형 학습보다 성능이 열 劣하지 않은 결과를 보장한다.

ABSTRACT

In this work, we propose a Semi-supervised Triply Robust Inductive transFer LEarning (STRIFLE) approach, which integrates heterogeneous data from a label-rich source population and a label-scarce target population and utilizes a large amount of unlabeled data simultaneously to improve the learning accuracy in the target population. Specifically, we consider a high dimensional covariate shift setting and employ two nuisance models, a density ratio model and an imputation model, to combine transfer learning and surrogate-assisted semi-supervised learning strategies effectively and achieve triple robustness. While the STRIFLE approach assumes the target and source populations to share the same conditional distribution of outcome Y given both the surrogate features S and predictors X, it allows the true underlying model of Y|X to differ between the two populations due to the potential covariate shift in S and X. Different from double robustness, even if both nuisance models are misspecified or the distribution of Y|(S, X) is not the same between the two populations, the triply robust STRIFLE estimator can still partially use the source population when the shifted source population and the target population share enough similarities. Moreover, it is guaranteed to be no worse than the target-only surrogate-assisted semi-supervised estimator with an additional error term from transferability detection. These desirable properties of our estimator are established theoretically and verified in finite samples via extensive simulation studies. We utilize the STRIFLE estimator to train a Type II diabetes polygenic risk prediction model for the African American target population by transferring knowledge from electronic health records linked genomic data observed in a larger European source population.

연구 동기 및 목표

  • 정밀의료에서 데이터 이질성과 공변량 이동으로 인한 저소비 인구 집단의 성능 저하 문제를 해결한다.
  • 풍부한 라벨이 없는 데이터를 활용하여 보조 특징을 기반으로 한 반감독형 학습을 통해 라벨이 부족한 임상 결과를 보완한다.
  • 두 불필요 모형(밀도 비율 및 보정)이 잘못 지정된 경우에도 정확도를 유지하는 전이 학습 프레임워크를 개발한다.
  • 모형이 잘못 지정된 경우에도 추정기의 성능이 타겟 전용 반감독형 학습보다 열 劣하지 않음을 보장한다.
  • 더 큰 라벨이 풍부한 소스 인구 집단으로부터 지식을 전이하여, 타겟 인구 집단에서 고차원적 위험 예측을 가능하게 한다.

제안 방법

  • 고차원적 공변량 이동 조건 하에서, 라벨이 풍부한 소스 인구 집단과 라벨이 부족한 타겟 인구 집단의 이질적 데이터를 통합한다.
  • 두 가지 불필요 모형을 활용한다: 소스와 타겟 간의 공변량 이동을 보정하기 위한 밀도 비율 모형과, 보조 특징을 사용하여 결과를 예측하기 위한 보정 모형.
  • 이중 강건 추정 방정식을 통해 전이 학습과 보조 특징 기반 반감독형 학습을 통합하여 삼중 강건성을 달성한다.
  • 두 불필요 모형 중 적어도 하나가 올바르게 지정되어 있거나, 예측 변수와 보조 특징에 조건부로 결과의 분포가 두 인구 집단 간에 동일할 경우 추정기가 일관성을 유지하도록 보장한다.
  • 고차원 예측 변수와 보조 특징을 다루기 위해 정규화된 추정 방정식 접근법을 사용하여 고차원 환경에서 변수 선택과 추정을 가능하게 한다.
  • 충분한 인구 유사성 조건 하에서, 두 불필요 모형이 잘못 지정된 경우에도 최종 추정기는 타겟 전용 반감독형 추정기보다 열 劣하지 않음을 보장한다.
Figure 1: The estimates of ${\bm{\beta}}_{0}$ for top signals with absolute magnitude above 0.1 from SUP, CS, SUPTrans, SAS, and STIFLE with SUPSource as a reference.
Figure 1: The estimates of ${\bm{\beta}}_{0}$ for top signals with absolute magnitude above 0.1 from SUP, CS, SUPTrans, SAS, and STIFLE with SUPSource as a reference.

실험 결과

연구 질문

  • RQ1밀도 비율 모형과 보정 모형이 모두 잘못 지정된 경우에도 전이 학습 방법이 타겟 인구 집단에서 성능을 유지할 수 있는가?
  • RQ2모형이 잘못 지정된 조건에서 제안된 STRIFLE 추정기는 타겟 전용 반감독형 학습에 비해 추정 정확도에서 어떻게 비교되는가?
  • RQ3큰 라벨이 풍부한 소스 인구 집단의 지식이 공변량 이동이 존재하는 작은 라벨이 부족한 타겟 인구 집단에서의 예측 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4STRIFLE의 삼중 강건성 특성은 예측 변수와 보조 특징에 조건부로 결과의 분포가 소스와 타겟 인구 집단 간에 다를 경우에도 신뢰할 수 있는 성능을 보장하는가?
  • RQ5예측 변수와 보조 특징의 수가 라벨가 있는 관측 수를 초과하는 고차원적 환경에서 STRIFLE는 얼마나 효과적인가?

주요 결과

  • STRIFLE는 삼중 강건성을 달성한다: 두 불필요 모형 중 적어도 하나가 올바르게 지정되어 있으면 일관성이 유지된다.
  • 두 불필요 모형이 잘못 지정되고, 예측 변수 및 보조 특징에 조건부로 결과의 분포가 두 인구 집단 간에 다를 경우에도, STRIFLE는 오차가 무시할 만큼 작고 타겟 전용 반감독형 추정기보다 성능이 열 劣하지 않게 유지된다.
  • 시뮬레이션 결과, STRIFLE는 더 큰 유럽계 소스 인구 집단에서의 지식을 전이함으로써 아프리카계 미국인 집단에서의 당뇨병 유전적 위험 점수 예측 정확도를 크게 향상시켰다.
  • 이 방법은 아프리카계 미국인 집단에서 유전자 마커 rs7903146, rs174546, rs1559474가 중요한 예측 변수로 성공적으로 식별되었으며, 이들의 효과 추정치는 알려진 생물학적 연관성과 일치하였다.
  • 모의 실험과 실제 응용 사례 모두에서 STRIFLE 추정기는 기준 방법보다 뛰어난 성능을 보였으며, 특히 고차원적 환경과 공변량 이동 조건에서 두각을 나타냈다.
  • 다양한 시뮬레이션 시나리오를 통해 방법의 강건성이 검증되었으며, 이는 이질적이고 제한된 데이터를 가진 실질적인 정밀의료 환경에서의 신뢰성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.