Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian Sparse Global-Local Shrinkage Regression for Selection of Grouped Variables

Zemei Xu, Daniel F. Schmidt|arXiv (Cornell University)|2017. 09. 13.
Statistical Methods and Inference참고 문헌 29인용 수 6
한 줄 요약

이 논문은 고차원 데이터에서 겹치는 구조와 다층적 그룹화를 다루기 위해 말뚝과 말뚝+ 사전을 사용하는 베이지안 군집화된 글로벌-로컬 수축 회귀 모델을 제안한다. 이는 군집 수준의 변수 선택을 위한 탈결합 수축 및 선택(DSS) 방법을 확장하고, 개선된 자유도 추정기법을 도입하여 BSGS와 같은 기존 방법들보다 뛰어난 군집 선택 정확도와 예측 성능을 달성한다. 특히 희박한 군집 설정에서 유의미한 성능 향상을 보인다.

ABSTRACT

Most estimates for penalised linear regression can be viewed as posterior modes for an appropriate choice of prior distribution. Bayesian shrinkage methods, particularly the horseshoe estimator, have recently attracted a great deal of attention in the problem of estimating sparse, high-dimensional linear models. This paper extends these ideas, and presents a Bayesian grouped model with continuous global-local shrinkage priors to handle complex group hierarchies that include overlapping and multilevel group structures. As the posterior mean is never a sparse estimate of the linear model coefficients, we extend the recently proposed decoupled shrinkage and selection (DSS) technique to the problem of selecting groups of variables from posterior samples. To choose a final, sparse model, we also adapt generalised information criteria approaches to the DSS framework. To ensure that sparse groups, in which only a few predictors are active, can be effectively identified, we provide an alternative degrees of freedom estimator for sparse Bayesian linear models that takes into account the effects of shrinkage on the model coefficients. Simulations and real data analysis using our proposed method show promising performance in terms of correct identification of active and inactive groups, and prediction, in comparison with a Bayesian grouped slab-and-spike approach.

연구 동기 및 목표

  • 복잡한 그룹화 구조, 즉 겹치는 구조와 다층적 그룹화를 포함한 희박한 고차원 회귀 모델을 선택하는 데 도전하는 것.
  • 연속적인 수축 사전이 후행 평균의 희박성을 생성하지 못하는 한계를 극복하기 위해, 군집 수준에서 탈결합 수축 및 선택(DSS) 프레임워크를 통합하는 것.
  • 개선된 자유도 추정기법을 사용하여 DSS 프레임워크에 일반화된 정보기준(GICs)을 적응시켜 군집 베이지안 회귀에서의 모델 선택을 향상시키는 것.
  • 특히 그룹 내 몇몇 예측 변수만 진짜로 관련이 있을 때, 희박한 모델에서 활성 군집을 효율적이고 정확하게 식별할 수 있도록 하는 것.
  • BSGS와 같은 기존의 베이지안 군집 방법들에 비해 예측 성능과 군집 선택 정확도에서 뛰어난 성능을 보임을 입증하는 것. 특히 소표본 및 고차원 설정에서 유의미한 성능 향상을 보인다.

제안 방법

  • 겹치는 구조와 다층적 그룹화를 포함한 군집화된 회귀 계수에 대해 글로벌-로컬 수축 사전(말뚝과 말뚝+)을 사용하는 계층적 베이지안 모델을 제안하여, 다양한 그룹화 구조에서의 탄력적인 수축을 가능하게 한다.
  • 탈결합 수축 및 선택(DSS) 방법을 군집 수준으로 확장하여, 군집 수준의 변수 선택을 위해 후행 평균 수축과 선택을 분리한다. 이를 위해 군집화된 비음수 가로트 기반 절차를 사용한다.
  • 계수 추정치에 대한 수축 효과를 고려한 군집 비음수 가로트 해법을 위한 새로운 자유도 추정기법을 도입하여, 모델 선택 정확도를 향상시킨다.
  • 모델 선택을 위해 그룹화된 DSS 프레임워크에 적합한 네 가지 정보기준(설명 분산, 초과 오차, BIC*, AIC*)을 적응시킨다.
  • 후행 분포를 MCMC를 통해 추출한 후, GICs를 사용한 DSS 기반 희박화 및 모델 선택 절차를 수행한다.
  • 예측 변수를 표준화하고 반응 변수를 중심화하는 재매개변수화 전략을 사용하여 고차원 설정에서의 안정성과 해석 가능성 확보.

실험 결과

연구 질문

  • RQ1겹치는 구조와 다층적 그룹화를 포함한 군집화된 회귀 모델에 대해 글로벌-로컬 수축 사전을 효과적으로 확장할 수 있는가?
  • RQ2탈결합 수축 및 선택(DSS) 방법은 어떻게 군집 수준의 변수 선택을 수행하면서도 계산 효율성을 유지할 수 있는가?
  • RQ3제안된 군집 비음수 가로트 해법을 위한 자유도 추정기법은 기존 추정기법에 비해 희박한 군집 설정에서 모델 선택 정확도를 향상시키는가?
  • RQ4제안된 방법의 성능은 베이지안 군집 슬랩-스피크(BCGS) 방법에 비해 군집 선택 정확도와 예측 오차 측면에서 어떻게 다른가?
  • RQ5그룹화된 DSS 프레임워크에 적응된 정보기준은 고차원 및 희박한 회귀 문제에서 히وري스틱 모델 선택 규칙을 능가하는가?

주요 결과

  • 후행 기대 자유도를 사용할 경우, 네 가지 정보기준(설명 분산, 초과 오차, BIC*, AIC*) 모두 동일한 군집 선택 결과를 도출하여 모델 선택의 강건성을 입증한다.
  • 출생 체중 데이터셋에서 최종 모델은 LWT, LWT², LWT³, RACE(흑인-백인 및 기타-백인), SMOKE, HT, UI 총 7개의 군집을 선택하였으며, 비교를 위해 상호작용 항목은 포함하지 않았다.
  • 제안된 방법은 BSGS 방법 대비 평균 제곱 예측 오차를 5.8%~6.0% 감소시켰으며, AIC*, AICc*, BIC* 기준에서 비율이 각각 0.940~0.946이었다.
  • 후행 평균 추정치는 가장 낮은 예측 오차(비율 0.906)를 기록했지만, 희박하지 않았다. 반면 제안된 DSS 기반 모델 선택은 근사 최적의 예측 성능를 가지는 희박한 모델을 도출하였다.
  • 소표본 정보기준(AICc* 등)을 사용한 결과, Hahn과 Carvalho(2015)의 원래 히وري스틱 기준에 비해 유의미하게 뛰어난 성능을 보였으며, 특히 고차원 및 희박한 설정에서 두드러진 성능 향상을 보였다.
  • 제안된 방법은 BSGS와 유사한 군집 식별 정확도를 보였지만, 훨씬 낮은 계산 비용을 기록하여 대규모 고차원 군집 회귀 문제에 대해 확장 가능한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.