Skip to main content
QUICK REVIEW

[논문 리뷰] Extended BIC for linear regression models with diverging number of relevant features and high or ultra-high feature spaces

Shan Luo, Zehua Chen|arXiv (Cornell University)|2011. 07. 13.
Statistical Methods and Inference참고 문헌 19인용 수 3
한 줄 요약

이 논문은 표본 크기와 함께 발산하는 관련 특징 수를 가진 고차원 또는 초고차원 특징 공간을 갖는 선형 회귀 모델에 베이즈 정보 기준(BIC)을 확장한다. 일반적인 조건 하에서 확장된 BIC(EBIC)의 선택 일致성을 확립하며, 관련 특징 수가 $ O(n^c) $ ( $ 0 < c < 1 $) 의 속도로 증가할 경우, $ p = O(n^k) $ 또는 $ p = O(e^{n^k}) $ 일지라도 진짜 모델을 일관되게 식별할 수 있음을 증명한다.

ABSTRACT

In many conventional scientific investigations with high or ultra-high dimensional feature spaces, the relevant features, though sparse, are large in number compared with classical statistical problems, and the magnitude of their effects tapers off. It is reasonable to model the number of relevant features as a diverging sequence when sample size increases. In this article, we investigate the properties of the extended Bayes information criterion (EBIC) (Chen and Chen, 2008) for feature selection in linear regression models with diverging number of relevant features in high or ultra-high dimensional feature spaces. The selection consistency of the EBIC in this situation is established. The application of EBIC to feature selection is considered in a two-stage feature selection procedure. Simulation studies are conducted to demonstrate the performance of the EBIC together with the two-stage feature selection procedure in finite sample cases.

연구 동기 및 목표

  • 고차원 또는 초고차원 선형 모델에서 관련 특징 수가 발산할 경우에도 선택 일치성을 유지하는 모델 선택 기준의 부족을 해결하고자 한다.
  • 진짜 특징 수가 표본 크기와 함께 증가할 때 확장된 BIC(EBIC)가 여전히 선택 일치성을 유지할 수 있는 이론적 조건을 설정하고자 한다.
  • 고정되거나 천천히 증가하는 관련 특징 수에 국한되지 않고, 표본 크기 $ n $ 과 함께 다항식 또는 지수적으로 증가하는 관련 특징 수가 존재하는 설정으로 EBIC의 적용 범위를 확장하고자 한다.
  • 소형-대규모-$ p $ 문제에서 펜리티 파ram터를 선택하기 위한 이론적으로 타당한 기준을 제공하고자 한다.
  • 두 단계 특징 선택 절차에서의 유한 표본 성능을 시뮬레이션 연구를 통해 검증하고자 한다.

제안 방법

  • 매개수 $ \gamma \in [0,1] $ 를 갖는 BIC의 확장된 형태인 EBIC를 제안하며, 이는 특징 수와 가능한 모델 수의 로그에 기반해 모델 복잡도를 페널티 처리한다.
  • 관련 특징 수 $ p_{0n} = O(n^c) $ ( $ 0 < c < 1 $) 라는 가정 하에 EBIC의 선택 일치성을 도출한다. 이때 $ p_n $ 은 $ n $ 에 대해 다항식 또는 지수적으로 증가한다.
  • 가장자리 우도 비와 잔차 제곱합의 점근적 분석을 통해 진짜 모델 $ s_{0n} $ 과 임의의 대안 모델 $ s $ 의 EBIC 값을 비교하며, EBIC가 진짜 모델을 확률적으로 점점 더 선호함을 보인다.
  • 잔차 제곱합의 확률적 행동을 제어하기 위해 농도 불등식과 카이제곱 꼬리 경계를 적용한다.
  • 두 단계 특징 선택 절차를 도입한다: 첫째, 필터링 단계에서 특징 공간을 축소한다; 둘째, 축소된 집합에서 EBIC를 사용해 최적의 모델을 선택한다.
  • 잔차 제곱합이 기대값에서 벗어나지 않도록 제어하기 위해 투영 행렬의 최대 고유값과 이차형식에 대한 이론적 경계를 활용한다.

실험 결과

연구 질문

  • RQ1고차원 또는 초고차원 선형 모델에서 관련 특징 수가 표본 크기와 함께 발산할 경우, 확장된 BIC(EBIC)의 선택 일치성은 어떤 조건에서 성립하는가?
  • RQ2관련 특징 수가 $ O(n^c) $ ( $ 0 < c < 1 $) 의 속도로 증가할 때, EBIC 매개수 $ \gamma $ 는 선택 일치성에 어떤 영향을 미치는가?
  • RQ3특징 수 $ p_n $ 이 표본 크기 $ n $ 과 다항식 또는 지수적으로 증가할 경우, EBIC는 여전히 선택 일치성을 유지할 수 있는가?
  • RQ4관련 진짜 특징 수가 발산하는 소형-대규모-$ p $ 문제에서 EBIC는 AIC, BIC, CV와 같은 전통적 기준과 비교해 선택 일치성 측면에서 어떻게 다른가?
  • RQ5두 단계 특징 선택 절차에서 EBIC를 사용할 경우, 그 유한 표본 성능는 어떠한가?

주요 결과

  • 관련 특징 수가 $ O(n^c) $ ( $ 0 < c < 1 $) 의 속도로 증가하고 $ p_n = O(n^k) $ 또는 $ p_n = O(e^{n^k}) $ ( $ 0 < k < 1 $) 일 경우, $ \gamma > \frac{1+\delta}{1-\delta} - \frac{\ln n}{2(1-\delta)\ln p_n} $ 를 만족하면 EBIC는 선택 일치성을 확보한다. 여기서 $ \delta = \lim \frac{\ln \nu(s)}{\ln p_n} $ 이다.
  • 관련 특징 수가 발산하는 고차원 환경에서 EBIC는 AIC, BIC, CV와 같은 전통적 기준보다 선택 일치성 측면에서 뛰어나다.
  • EBIC는 관련 특징 수가 표본 크기와 함께 증가함에도 불구하고 선택 일치성을 유지하지만, 이는 고전적 BIC나 AIC에서는 보장되지 않는다.
  • 시뮬레이션 연구를 통해 EBIC 기반의 두 단계 특징 선택 절차가 실용 표본에서 높은 진짜 양성률과 낮은 가짜 양성률을 달성함을 확인하였다.
  • 이론적 분석 결과, 진짜 모델과 임의의 대안 모델 간의 EBIC 값 차이가 확률적으로 무한히 발산함을 보여, 일관된 모델 선택이 보장됨을 입증하였다.
  • EBIC에서 $ \gamma = 1 $ 일 경우, 유전적 QTL 맵핑에서 사용되는 mBIC 기준에 점차 수렴함을 보여, 잘 알려진 적용 맥락에서의 일致성에 대한 타당성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.