Skip to main content
QUICK REVIEW

[논문 리뷰] BayesVarSel: Bayesian Testing, Variable Selection and model averaging in Linear Models using R

Gonzalo García‐Donato, Anabel Forte|arXiv (Cornell University)|2016. 11. 24.
Statistical Mechanics and Entropy참고 문헌 3인용 수 4
한 줄 요약

이 논문은 선형 모형에서 목적적 베이지안 가설 검정, 변수 선택, 모형 평균화를 위한 BayesVarSel R 패키지를 소개한다. 이 패키지는 사전 분포 기반 기준을 사용하여 후행 모형 확률을 정확하고 히우리스틱 방법으로 계산할 수 있도록 하며, 모형 평균화를 통한 추정 및 예측을 가능하게 한다. 이는 응용 연구에서 널리 사용할 수 있도록 R의 lm 함수를 영감으로 삼은 직관적인 인터페이스를 제공한다.

ABSTRACT

This paper introduces the R package BayesVarSel which implements objective Bayesian methodology for hypothesis testing and variable selection in linear models. The package computes posterior probabilities of the competing hypotheses/models and provides a suite of tools, specifically proposed in the literature, to properly summarize the results. Additionally, \ourpack\ is armed with functions to compute several types of model averaging estimations and predictions with weights given by the posterior probabilities. BayesVarSel contains exact algorithms to perform fast computations in problems of small to moderate size and heuristic sampling methods to solve large problems. The software is intended to appeal to a broad spectrum of users, so the interface has been carefully designed to be highly intuititive and is inspired by the well-known lm function. The issue of prior inputs is carefully addressed. In the default usage (fully automatic for the user)BayesVarSel implements the criteria-based priors proposed by Bayarri et al (2012), but the advanced user has the possibility of using several other popular priors in the literature. The package is available through the Comprehensive R Archive Network, CRAN. We illustrate the use of BayesVarSel with several data examples.

연구 동기 및 목표

  • 선형 모형에서 목적적 베이지안 추론을 위한 사용자 友好的 R 패키지를 개발하여 변수 선택 및 가설 검정 문제를 해결한다.
  • 작소에서 중간 크기의 문제에 대해 효율적인 후행 확률 계산을 위한 정확한 및 히우리스틱 계산 방법을 구현한다.
  • 후행 모형 가중치를 통한 모형 평균화를 지원하여 모형 불확실성 하에서 견고한 추정 및 예측을 가능하게 한다.
  • 표준 lm 함수를 영감으로 삼은 직관적인 인터페이스를 제공하여 응용 연구자들이 베이지안 방법을 쉽게 접근할 수 있도록 한다.
  • 사전 분포 선택 문제를 해결하기 위해 기준 기반 목적적 사전 분포를 통합하면서도 고급 사용자가 대체 사전 분포를 지정할 수 있도록 한다.

제안 방법

  • 기준 기반 사전 분포(예: Bayarri 등, 2012)를 사용하여 자동으로 비정보성 사전 분포를 설정하는 목적적 베이지안 방법론을 사용한다.
  • 중간 크기 문제에서 후행 모형 확률을 신속하게 계산하기 위해 정확한 알고리즘을 적용한다.
  • 정확한 계산이 불가능한 대규모 문제에서는 히우리스틱 샘플링 방법(MCMC 등)을 적용한다.
  • 후행 모형 확률을 통한 모형 평균화를 구현하여 모형 불확실성을 고려한 추정 및 예측을 가능하게 한다.
  • 베이지안 검정을 위한 Btest, 모형 평균화 계수 추정을 위한 BMAcoeff, 예측 시뮬레이션을 위한 predictBvs 등의 함수를 제공한다.
  • 모형 평균화에서 예측 분포로 다변량 스튜던트의 t분포를 사용하여 모형 및 매개변수 추정의 불확실성을 통합한다.

실험 결과

연구 질문

  • RQ1어떻게 하면 선형 모형에서 변수 선택 및 가설 검정에 대해 목적적 베이지안 방법을 효율적으로 구현할 수 있는가?
  • RQ2정확한 및 히우리스틱 알고리즘의 후행 모형 확률 계산 성능은 다양한 문제 크기에서 어떻게 나타나는가?
  • RQ3모형 불확실성이 존재할 때 모형 평균화가 추정 및 예측 정확도를 어떻게 향상시킬 수 있는가?
  • RQ4기준 기반 사전 분포는 주관적인 입력 없이 자동으로 목적적인 추론을 보장하는 데 얼마나 효과적인가?
  • RQ5비전문가 사용자들이 쉽게 접근할 수 있도록 베이지안 패키지의 인터페이스는 어떻게 설계할 수 있는가?

주요 결과

  • 쥐의 체중 증가 예시에서 H0에 대한 후행 확률이 0.554, H1에 대한 후행 확률이 0.446로 나타나 고단백 식이요법이 평균 체중 증가에 영향을 주지 않는 강력한 증거는 없다.
  • 저축 데이터셋에서 H1(완전 모형)의 후행 확률은 0.954로, 모든 예측변수(dpi, ddpi, pop15, pop75)가 반응변수 sr를 설명하는 데 강력한 증거를 제공한다.
  • 저축 데이터셋에서 다수의 모형을 비교한 결과, H1의 후행 확률은 0.925였고, H2(pop15 제외)는 0.031로 나타나 pop15가 모형에 의미 있는 기여를 한다고 보여진다.
  • SDM 데이터셋에서 P60의 포함 확률은 0.77이었고, 그 효과가 1을 초과할 확률은 모형 평균화를 통해 0.7511로 추정되었다.
  • predictBvs를 사용한 예측 시뮬레이션은 단일 모드 예측 분포를 생성하였으며, 평균 공변수 값에 대한 예측 히스토GRAM은 뚜렷한 중심 경향성을 보였다.
  • 이 패키지는 다수의 가설을 포함한 복잡한 모형 비교 작업을 성공적으로 처리하며 고차원 설정에서도 신뢰할 수 있고 해석 가능한 요약을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.