Skip to main content
QUICK REVIEW

[논문 리뷰] Bootstrapping Clustered Data in R using lmeresampler

Adam Loy, Jenna Korobova|arXiv (Cornell University)|2021. 06. 11.
Bayesian Methods and Mixture Models인용 수 12
한 줄 요약

이 논문은 R에서 선형 혼합효과 모델의 부트스트래핑을 위한 lmeresampler 패키지를 소개한다. 이 패키지는 군집화된 데이터를 위한 다섯 가지 부트스트랩 방법—사례, 잔차, 매개수치, 와일드, 블록 부트스트랩—을 제공한다. 이는 편향 보정 추론, 신뢰구간, 모수 함수 추정을 가능하게 하며, doParallel 및 foreach를 통한 병렬 계산 지원도 제공한다.

ABSTRACT

Linear mixed-effects models are commonly used to analyze clustered data structures. There are numerous packages to fit these models in R and conduct likelihood-based inference. The implementation of resampling-based procedures for inference are more limited. In this paper, we introduce the lmeresampler package for bootstrapping nested linear mixed-effects models fit via lme4 or nlme. Bootstrap estimation allows for bias correction, adjusted standard errors and confidence intervals for small samples sizes and when distributional assumptions break down. We will also illustrate how bootstrap resampling can be used to diagnose this model class. In addition, lmeresampler makes it easy to construct interval estimates of functions of model parameters.

연구 동기 및 목표

  • R에서 선형 혼합효과(LME) 모델을 위한 접근하기 쉬운 사용자 友好的 부트스트랩 절차가 부족한 문제를 해결하기 위해, 특히 군집화되거나 다수준 데이터에 대해.
  • lme4나 nlme로 피팅된 LME 모델에 특화된 다섯 가지 부트스트랩 방법(사례, 잔차, 매개수치, 와일드, 블록)을 위한 통합된 사용자 친화적 인터페이스를 제공하기 위해.
  • 분포 가정이 위반되거나 표본 크기가 작을 경우에도 편향 보정, 표준오차 조정, 신뢰구간 추정 등 강력한 통계적 추론을 가능하게 하기 위해.
  • 반복성과 같은 모수 함수의 복잡한 추정을 부트스트랩 기반 방법을 통해 수행할 수 있도록 하기 위해.
  • doParallel 및 foreach 통합을 통해 병렬 부트스트랩을 지원하여 대규모 부트스트랩의 계산 효율성을 향상시키기 위해.

제안 방법

  • lmeresampler 패키지는 다섯 가지 부트스트랩 절차를 구현한다: 사례(비모수적), 잔차, 매개수치, 와일드, 블록 부트스트랩이며, 모두 중첩된 가우시안 LME 모델에 적합하도록 설계되었다.
  • bootstrap() 함수는 통합된 인터페이스 역할을 하며, 사용자가 부트스트랩 유형(type = 'parametric' 등)과 부트스트랩 반복 수(B)를 지정할 수 있도록 한다.
  • 매개수치 부트스트랩의 경우, 패키지는 피팅된 모델의 추정 모수(β̂, D̂, σ̂²)를 사용하여 조건부 분포 y|b ~ N(Xβ + Zb, σ²I)에서 새로운 반응 벡터 y*를 시뮬레이션한다.
  • 잔차 및 와일드 부트스트랩 방법은 잔차(마진형 또는 조건부)를 재표본 추출하여 오차 구조를 유지하면서 새로운 반응 데이터를 생성한다.
  • 블록 부트스트랩은 전체 관측 군집을 재표본 추출함으로써 군집 수준의 의존성을 유지하여 계층적 구조를 보존한다.
  • 패키지는 foreach 및 doParallel를 사용하여 코어별로 병행 실행된 여러 부트스트랩 실행 결과를 결합하는 combine_lmeresamp() 유틸리티 함수를 통해 병렬 처리를 지원한다.

실험 결과

연구 질문

  • RQ1어떻게 군집화된 데이터를 가진 선형 혼합효과 모델에 부트스트랩 재표본 추출을 효과적으로 적용하여 표본 크기가 작거나 분포 가정이 위반된 경우의 추론을 향상시킬 수 있는가?
  • RQ2중첩된 LME 모델에 가장 적합한 부트스트랩 방법(예: 매개수치, 잔차, 블록)은 무엇이며, 편향 보정 및 커버리지 측면에서 어떻게 비교할 수 있는가?
  • RQ3단일 사용자 우호적인 R 패키지를 통해 LME 모델을 위한 여러 부트스트랩 절차에 접근할 수 있도록 단순화할 수 있는가, 이를 통해 맞춤형 코드나 외부 소프트웨어 의존도를 줄일 수 있는가?
  • RQ4R에서 어떻게 부트스트랩을 효율적으로 병렬화하여 LME 모델의 대규모 재표본 추출에 소요되는 계산 시간을 줄일 수 있는가?
  • RQ5부트스트랩 기반 방법을 사용하여 반복성과 같은 모수 함수의 추정치에 신뢰구간을 신뢰성 있게 제공할 수 있는가?

주요 결과

  • lmeresampler 패키지는 R에서 중첩된 선형 혼합효과 모델에 대해 다섯 가지 부트스트랩 방법—사례, 잔차, 매개수치, 와일드, 블록—을 성공적으로 구현하였다.
  • lmeresampler의 매개수치 부트스트랩은 JSP 데이터셋에서 'time'의 고정효과에 대해 [0.299, 0.480]의 95% 신뢰구간을 생성하여 실용적인 구간 추정을 입증하였다.
  • 패키지는 반복성과 같은 모수 함수의 추정을 부트스트랩 신뢰구간을 통해 가능하게 하였으며, 이는 벌레 데이터셋 예제에서 확인되었다.
  • 두 코어를 사용한 병렬 부트스트랩은 2000회 부트스트랩 반복의 실행 시간을 단일 코어의 약 38.8초에서 약 19.3초로 단축시켜 약 2.01배의 성능 향상을 달성하였다.
  • combine_lmeresamp() 함수는 병행 실행된 여러 부트스트랩 런의 결과를 단일 lmeresamp 객체로 효과적으로 통합하여 일관된 후속 분석을 가능하게 하였다.
  • 패키지는 cases, residual, parametric 부트스트랩을 위한 glmer()를 통한 일반화선형혼합모형(GLMM) 지원을 제공하며, 교차 랜덤 효과를 가진 모델의 매개수치 부트스트랩도 가능하지만, 이러한 경우 성능이 최적화되지 않을 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.