Skip to main content
QUICK REVIEW

[논문 리뷰] Prior Adaptive Semi-supervised Learning with Application to EHR Phenotyping

Yichi Zhang, Molei Liu|PubMed|2020. 03. 26.
Machine Learning in Healthcare참고 문헌 40인용 수 5
한 줄 요약

이 논문은 고차원 희소 회귀 방법인 Prior Adaptive Semi-supervised Learning (PASS)을 제안한다. 이 방법은 소량의 레이블된 데이터, 대량의 레이블이 없는 데이터(특징 X만 존재) 및 진짜 표현형 Y를 예측할 수 있는 보조 변수 S를 활용한다. S로부터 유도된 사전 방향으로 추정량을 적응적으로 수축시킴으로써, 추정의 효율성과 강건성을 향상시키며, 시뮬레이션과 종합 병원 시스템에서의 실제 EHR 표현형 분석 응용에서 기존 방법들을 능가한다.

ABSTRACT

Electronic Health Record (EHR) data, a rich source for biomedical research, have been successfully used to gain novel insight into a wide range of diseases. Despite its potential, EHR is currently underutilized for discovery research due to its major limitation in the lack of precise phenotype information. To overcome such difficulties, recent efforts have been devoted to developing supervised algorithms to accurately predict phenotypes based on relatively small training datasets with gold standard labels extracted via chart review. However, supervised methods typically require a sizable training set to yield generalizable algorithms, especially when the number of candidate features, <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>p</mml:mi></mml:math>, is large. In this paper, we propose a semi-supervised (SS) EHR phenotyping method that borrows information from both a small, labeled dataset (where both the label <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>Y</mml:mi></mml:math> and the feature set <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>X</mml:mi></mml:math> are observed) and a much larger, weakly-labeled dataset in which the feature set <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>X</mml:mi></mml:math> is accompanied only by a surrogate label <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>S</mml:mi></mml:math> that is available to all patients. Under a <i>working</i> prior assumption that <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>S</mml:mi></mml:math> is related to <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>X</mml:mi></mml:math> only through <mml:math xmlns:mml="http://www.w3.org/1998/Math/MathML"><mml:mi>Y</mml:mi></mml:math> and allowing it to hold <i>approximately</i>, we propose a prior adaptive semi-supervised (PASS) estimator that incorporates the prior knowledge by shrinking the estimator towards a direction derived under the prior. We derive asymptotic theory for the proposed estimator and justify its efficiency and robustness to prior information of poor quality. We also demonstrate its superiority over existing estimators under various scenarios via simulation studies and on three real-world EHR phenotyping studies at a large tertiary hospital.

연구 동기 및 목표

  • EHR 표현형 분석에서 차트 리뷰로부터 확보된 홨금표준 레이블이 비용이 많이 들고 희소한 문제를 해결하기 위해.
  • 특징 수 p가 표본 크기 대비 큰 고차원 설정에서 추정 효율성과 강건성을 향상시키기 위해.
  • 진짜 표현형 Y와 관련이 있지만 완전히 일치하지는 않는 보조 변수 S로부터의 사전 지식을 효과적으로 통합할 수 있는 준지도 학습 프레임워크를 개발하기 위해.
  • 사전 정보(예: S에서 유래된 것)의 품질이 낮거나 조건부 독립 가정이 위반될 경우에도 방법이 강건하게 유지되도록 하기 위해.
  • X와 S를 모두 사용하여 질병 상태 Y를 정확하게 예측하면서도, 고차원 특징 공간에서 통계적 효율성과 희소성을 유지하기 위해.

제안 방법

  • PASS는 단일색인 모델 프레임워크 하에서 레이블이 있는 데이터(Y, X)와 레이블이 없는 데이터(X, S)를 동시에 고려하는 정규화 추정 문제를 설정한다.
  • 이 방법은 계수 벡터 β를 ρα* 방향으로 수축시키는 펜alties를 도입한다. 여기서 α*는 S ~ X에 대한 ALASSO 회귀를 통해 추정된 사전 방향이며, ρ는 사전 정보와 데이터 기반 추정 간의 균형을 맞추기 위해 적응적으로 선택된다.
  • 이 방법은 이중 단계 추정을 사용한다. 첫 번째 단계에서는 S를 X에 대해 ALASSO 회귀하여 보조 방향 α*를 추정하고, 두 번째 단계에서는 β를 β − ρα*의 희소성을 유도하는 정규화 가능도 기반으로 추정한다.
  • 이론적 근거는 제한된 고유값 가정과 β₀ − ρα₀의 희소성에 기반하며, 이는 레이블이 없는 데이터가 추정에 의미 있게 기여할 수 있음을 보장한다.
  • 적응적 수축 메커니즘이 있기 때문에 조건부 독립 가정 S ⊥ X | Y 위반에 대해서도 강건성이 확보된다.
  • 다중 보조 변수를 통합하기 위해 다중 S_k와 그에 대응하는 α*_k를 통합한 펜alty 구조로 확장 가능하다.

실험 결과

연구 질문

  • RQ1소량의 레이블된 데이터만 존재할 때, 대량의 레이블이 없는 EHR 데이터를 효과적으로 활용할 수 있는 준지도 학습 방법이 존재하는가?
  • RQ2사전 지식이 정확하지 않을 경우 성능이 떨어지지 않도록 보조 변수 S로부터의 지식을 고차원 회귀에 적응적으로 통합할 수 있는가?
  • RQ3조건부 독립 가정 S ⊥ X | Y 가 위반될 경우에도 제안된 PASS 추정량이 추정 효율성과 강건성을 유지하는가?
  • RQ4기존의 지도 학습 및 준지도 학습 기반 방법들과 비교해 실제 EHR 시스템에서 표현형 분석 정확도를 향상시킬 수 있는가?
  • RQ5고차원, 희소성, 공선성 존재 조건 하에서 추정량의 일致성과 점근적 효율성에 대한 이론적 근거는 무엇인가?

주요 결과

  • PASS는 시뮬레이션 연구에서 기존 방법들을 뛰어넘으며, 특히 고차원 특징과 노이즈가 많거나 약한 보조 변수가 존재하는 상황에서 뛰어난 성능을 보였다.
  • 대규모 종합 병원 시스템에서의 실제 EHR 표현형 분석 응용에서, PASS는 더 높은 AUC를 달성하여 예측 정확도 향상을 입증했다.
  • 보조 변수 S가 Y를 예측하는 데 중간 정도의 예측력을 가지더라도 PASS는 강건성을 유지하며 열악한 품질의 사전 정보에 대비한 내성을 보였다.
  • 이론적 분석을 통해 β₀ − ρα₀가 희소하다는 가정 하에 추정량의 일치성과 점근적 효율성이 확인되었으며, 이는 레이블이 없는 데이터의 효과적 활용을 가능하게 했다.
  • 진짜 신호가 약하거나 설계 행렬이 타원형 분포가 아닐 경우 pLASSO와 SS^prior에 비해 더 나은 변수 선택 성능을 보였다.
  • 실증 결과는 PASS가 S만을 기반으로 한 기존 비지도 방법의 한계인 P(Y=1 | S, X)의 척도를 효과적으로 복원할 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.