Skip to main content
QUICK REVIEW

[논문 리뷰] Projection predictive variable selection using Stan+R

Juho Piironen, Aki Vehtari|arXiv (Cornell University)|2015. 08. 11.
Advanced Statistical Methods and Models참고 문헌 11인용 수 19
한 줄 요약

이 논문은 선형 가우시안 모델에서 베이지안 모델 피팅을 위해 Stan을, 변수 선택을 위해 R을 사용하여 투영 예측 변수 선택의 실용적 구현을 제시한다. 계층적 수축 사전분포(예: 자유도 $ν=3$인 호르슈프)를 사용할 경우, 이 방법은 약 5~20개의 변수만을 사용하여 전체 모델의 예측 성능에 근접한 성능을 달성하며, 안정적인 MCMC 샘플링과 교차검증을 통한 강건한 변수 선택을 보장한다.

ABSTRACT

This document is additional material to our previous study comparing several strategies for variable subset selection. Our recommended approach was to fit the full model with all the candidate variables and best possible prior information, and perform the variable selection using the projection predictive framework. Here we give an example of performing such an analysis, using Stan for fitting the model, and R for the variable selection.

연구 동기 및 목표

  • Stan과 R을 사용한 베이지안 변수 선택을 위한 확장 가능하고 강건한 워크플로우를 제시하는 것.
  • 호르슈프와 같은 무거운 尾 꼬리 사전분포를 사용할 경우 NUTS 샘플링의 불안정성을 해결하기 위해 계층적 수축 사전분포의 자유도($ν$)를 조정하는 것.
  • 투영 예측 변수 선택이 전체 모델의 예측 성능을 유지하는 최소한의 변수 조합을 신뢰성 있게 식별할 수 있음을 보여주는 것.
  • 교차검증과 테스트 세트 평가를 포함한 UCI Communities and Crime 데이터셋을 사용한 실용적이고 재현 가능한 예제를 제공하는 것.

제안 방법

  • 기본 선형 가우시안 회귀 모델을 Stan을 사용하여 피팅하며, 계층적 수축 사전분포(HS-$t_\nu$)를 회귀 계수에 적용하고, 절편, 글로벌 스케일 $\tau$, 잡음 분산 $\sigma^2$에 대해 약한 정보를 가진 사전분포를 사용한다.
  • 국소 스케일 매개변수 $\lambda_i$와 글로벌 스케일 $\tau$에 대해 반-스테이던트-$t$ 사전분포를 사용하며, $\nu=3$으로 설정하여 발산 전이를 줄이면서도 흩어짐을 유지한다.
  • 투영 예측 변수 선택을 적용: 하위모델에 변수를 순차적으로 추가하여 하위모델과 전체 모델의 예측 분포 간의 쿨백-라이블러 발산을 최소화한다.
  • 전진 탐색 히우리스틱을 사용: 각 단계에서 전체 모델의 예측 분포와의 KL 발산을 가장 크게 감소시키는 변수를 선택한다.
  • 10개의 교차검증 폴드를 사용하여 성능을 평가하고, 평균 로그 예측 밀도(MLPD)와 평균 제곱오차(MSE)를 사용하여 테스트 세트 평가를 수행한다.
  • R을 사용하여 후처리, 변수 순위 매기기, 하위모델과 전체 모델 간의 성능 비교를 수행한다.

실험 결과

연구 질문

  • RQ1중간 정도 꼬리 무게를 가지는 계층적 수축 사전분포($\nu=3$)를 사용할 경우, MCMC 샘플링의 안정성을 확보하면서도 호르슈프 사전분포의 흩어짐 유도 성질을 유지할 수 있는가?
  • RQ2투영 예측 변수 선택이 전체 모델의 예측 성능을 최소한의 변수 조합으로 얼마나 잘 복원하는가?
  • RQ3전체 모델과 예측 성능이 구분되지 않을 정도로 필요한 최소한의 변수 수는 얼마인가?
  • RQ4교차검증 성능 추정치가 변수 선택에서 테스트 세트 성능과 어떻게 비교되는가?

주요 결과

  • HS-$t_\nu$ 사전분포에서 $\nu=3$을 사용할 경우, HS-$t_3$와 HS-$t_3$+에 대해 각각 0.0%와 0.1%로 발산 전이가 감소했으며, $\nu=1$일 경우 3.4%와 5.2%였던 것과 비교해도 예측 성능에 영향을 주지 않았다.
  • 전체 모델의 예측 능력은 약 5개의 변수로도 거의 동일한 수준의 평균 로그 예측 밀도(MLPD)와 평균 제곱오차(MSE) 차이를 보이며 달성된다.
  • 20개의 변수까지 도달하면 하위모델의 예측 성능은 실질적으로 전체 모델과 구분되지 않으며, MLPD와 MSE의 차이는 거의 0에 가깝다.
  • 교차검증 성능가 테스트 세트 성능이 매우 유사하여, 이 프레임워크에서 모델 선택을 위한 교차검증의 신뢰성이 검증되었다.
  • 전진 탐색 히우리스틱은 일관된 결과를 보이며 가장 관련성이 높은 변수를 효과적으로 식별하였다. 이는 교차검증 폴드와 테스트 데이터에서 모두 일관되게 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.