Skip to main content
QUICK REVIEW

[논문 리뷰] Inference for the Case Probability in High-dimensional Logistic Regression

Zijian Guo, Prabrisha Rakshit|arXiv (Cornell University)|2020. 12. 13.
Statistical Methods and Inference참고 문헌 41인용 수 9
한 줄 요약

이 논문은 선형화 및 분산 강화 기법을 사용하여 고차원 로지스틱 회귀에서 사례 확률에 대한 편향 보정 추정량을 제안한다. 추정량의 점근적 정규성을 확립하고, 표본 크기보다 예측 변수의 수가 많은 경우에도 신뢰구간과 가설 검정을 통한 타당한 추론을 가능하게 한다.

ABSTRACT

Labeling patients in electronic health records with respect to their statuses of having a disease or condition, i.e. case or control statuses, has increasingly relied on prediction models using high-dimensional variables derived from structured and unstructured electronic health record data. A major hurdle currently is a lack of valid statistical inference methods for the case probability. In this paper, considering high-dimensional sparse logistic regression models for prediction, we propose a novel bias-corrected estimator for the case probability through the development of linearization and variance enhancement techniques. We establish asymptotic normality of the proposed estimator for any loading vector in high dimensions. We construct a confidence interval for the case probability and propose a hypothesis testing procedure for patient case-control labelling. We demonstrate the proposed method via extensive simulation studies and application to real-world electronic health record data.

연구 동기 및 목표

  • 고차원 전자 건강 기록 기반 예측 모델에서 사례 확률에 대한 타당한 통계적 추론 방법의 부족을 해결하기 위해.
  • p ≫ n 인 경우 질병 상태의 조건부 확률(사례 확률)에 대한 신뢰할 수 있는 추정량을 개발하기 위해.
  • 전자 건강 기록에서 환자 사례-대조군 레이블링에 대한 가설 검정과 신뢰구간 구축을 가능하게 하기 위해.
  • 관심 기능인 h(x*ᵀβ)에 대한 타당한 추론을 통합함으로써 기존의 정규화 추정 방법을 확장하기 위해.
  • EHR 데이터를 활용한 주로 알도스테론증 스크리닝 대상 환자 식별과 같은 임상 표현형 분석 작업을 지원하기 위해.

제안 방법

  • 추정 방정식의 선형화를 통해 사례 확률 h(x*ᵀβ)에 대한 편향 보정 추정량을 개발한다.
  • 고차원 설정에서 추정량의 분산을 안정화하기 위해 분산 강화 기법을 적용한다.
  • 임의의 색인 집합 위에서 경험 과정의 최대값을 제어하기 위해 수축 원리와 대칭화를 사용한다.
  • 서브가우시안 농도를 활용한 라데마처 복잡도 유사 추론을 사용하여 경험 과정 항을 바ounds한다.
  • 설계 행렬의 희박성 및 모멘트 조건 하에서 추정량의 점근적 정규성을 도출한다.
  • 추정량의 점근적 분포를 바탕으로 신뢰구간과 가설 검정을 구성한다.

실험 결과

연구 질문

  • RQ1p ≫ n 인 고차원 로지스틱 회귀에서 사례 확률 h(x*ᵀβ)에 대해 타당한 통계적 추론을 수행할 수 있는가?
  • RQ2희박한 고차원 모델에서 사례 확률 추정치의 편향을 어떻게 보정하여 신뢰할 수 있는 추론을 가능하게 할 수 있는가?
  • RQ3고차원 점근적 조건 하에서 사례 확률 추정량의 점근적 분포는 무엇인가?
  • RQ4EHR 데이터를 사용하여 환자 사례-대조군 레이블링에 대한 신뢰구간과 가설 검정을 구성할 수 있는가?
  • RQ5기본 정규화 추정량과 비교해 볼 때 제안된 방법은 유한 표본에서 어떻게 성능을 발휘하는가?

주요 결과

  • 제안된 사례 확률에 대한 편향 보정 추정량은 고차원 점근적 조건 하에서 점근적으로 정규분포를 따른다.
  • 추정량은 고차원에서 임의의 고정된 로딩 벡터 x*에 대해 타당한 추론을 달성한다.
  • 점근적 정규성 가정 하에서 사례 확률에 대한 신뢰구간은 올바른 커버리지 확보를 한다.
  • H₀: h(x*ᵀβ) < 1/2 에 대한 가설 검정은 타당하며, 제1종 오류 비율을 정확히 유지한다.
  • 광범위한 시뮬레이션과 펜 나이언드 메디슨 EHR 데이터에 대한 실제 적용을 통해 방법의 강건성을 입증하였다.
  • 희박성, 서브가우시안 설계, 설계 행렬과 파라미터 벡터에 대한 규칙성 조건 하에서 이론적 보장이 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.