Skip to main content
QUICK REVIEW

[논문 리뷰] Parsimoniously Fitting Large Multivariate Random Effects in glmmTMB

Maeve McGillycuddy, Gordana Popović|arXiv (Cornell University)|2024. 11. 07.
Statistical Methods and Inference인용 수 4
한 줄 요약

이 논문은 glmmTMB R 패키지에서 고차원 다변량 반복 효과를 표현하기 위해 잠재 변수 수 d < q로 줄인 질량을 도입하여, 복잡한 혼합 모형의 고차원 상관관계 구조를 효율적으로 추정할 수 있도록 한다. 이 방법은 생태학 및 사회과학 데이터에서 다변량 반응 변수의 확장 가능한 모델링을 가능하게 하여, 비정규 공분산 행렬의 수렴 및 계산적 한계를 극복한다.

ABSTRACT

Multivariate random effects with unstructured variance-covariance matrices of large dimensions, $q$, can be a major challenge to estimate. In this paper, we introduce a new implementation of a reduced-rank approach to fit large dimensional multivariate random effects by writing them as a linear combination of $d &lt; q$ latent variables. By adding reduced-rank functionality to the package glmmTMB, we enhance the mixed models available to include random effects of dimensions that were previously not possible. We apply the reduced-rank random effect to two examples, estimating a generalized latent variable model for multivariate abundance data and a random-slopes model.

연구 동기 및 목표

  • 일반선형혼합모형에서 큰 차원(q)을 가진 비정규 다변량 반복 효과를 적합하는 데 있어 계산 및 추정 과제를 해결하기 위해.
  • glmmTMB 패키지에 감소 질량 요인 분석 구조를 통합하여 고차원 다변량 반복 효과를 효율적으로 처리하기 위해.
  • 다층 및 반복 측정 등의 복잡한 연구 설계를 민감하게 모델링하면서도 단순성과 계산 가능성 유지하기 위해.
  • 종 분포나 설문 항목과 같은 많은 수의 상관관계가 있는 반응 변수를 가진 일반선형잠재변수모형(GLVM)에 실용적인 해결책을 제공하기 위해.
  • 이전에는 표준 혼합모형 패키지로는 비가능했던 고차원 반복 효과(예: 수백 또는 수천 마리 종)의 추정을 가능하게 하기 위해.

제안 방법

  • 큰 차원의 다변량 반복 효과(q)를 d < q인 잠재 변수의 선형 조합으로 표현하여 추정해야 할 매개변수 수를 q(q+1)/2에서 d(q + d)/2로 줄인다.
  • 반복 효과 벡터가 η = Lξ로 표현되는 요인 분석 모형 구조를 사용하며, 여기서 ξ ~ N(0, I_d)이고 L은 q×d 적재 행렬이다.
  • 자동 미분과 라플라스 근사법을 사용하여 glmmTMB 내부에서 국소 가능도를 신속하게 추정한다.
  • 기존의 glmmTMB 인터페이스에 감소 질량 구조를 통합하여 표준 혼합모형 문법과 다양한 지수족 가족을 지원하는 방식으로 원활한 사용을 가능하게 한다.
  • 다중 시작값과 정보 기준(예: AIC)과 같은 최적화 전략을 적용하여 최적의 질량 d를 선택한다.
  • 설계상으로도 특이 공분산 행렬을 허용하여, q가 클 경우 일반적으로 발생하는 정규 공분산 추정의 수렴 문제를 피한다.
Figure 1: Boxplot of fish abundance ( $\log(y+1)$ scale) for each species at three zones, windfarm (WF, green), north (N, orange), and south (S, lilac), before (2003) and after (2010) construction of the offshore wind farm.
Figure 1: Boxplot of fish abundance ( $\log(y+1)$ scale) for each species at three zones, windfarm (WF, green), north (N, orange), and south (S, lilac), before (2003) and after (2010) construction of the offshore wind farm.

실험 결과

연구 질문

  • RQ1감소 질량 요인 분석 구조가 glmmTMB에 효과적으로 통합되어 고차원 다변량 반복 효과를 추정할 수 있는가?
  • RQ2큰 q에 대해 비정규 공분산 행렬과 비교했을 때 감소 질량 접근법이 추정의 안정성과 계산 가능성에 어떻게 기여하는가?
  • RQ3잠재 변수 공간의 질량 d가 변화함에 따라 고정 효과 추정치와 통계적 추론은 어느 정도 변화하는가?
  • RQ4이 방법은 다층 또는 반복 측정과 같은 복잡한 연구 설계에 고차원 반응 변수를 적용할 수 있는가?
  • RQ5진정한 차원이 알려지지 않은 상황에서 실무적으로 최적의 질량 d를 선택하는 데 효과적인 전략은 무엇인가?

주요 결과

  • glmmTMB에서의 감소 질량 접근법은 이전에는 lme4나 glmmTMB의 질량 감소 없이선 비가능했던 수백 또는 수천 차원의 다변량 반복 효과 추정이 가능하게 하였다.
  • 9종의 어류 밀도 데이터셋에서 비정규 모형은 수렴하지 못했지만, d=2인 감소 질량 모형은 종 간 상관관계를 성공적으로 추정하였다.
  • 15개의 결과 변수를 가진 PIRLS 교육 연구에서 감소 질량 모형은 안정적인 추정치와 강인한 고정 효과 추론을 제공하였으며, d의 중간 정도 변화에 대해 결과가 민감하지 않았다.
  • 설계상으로 특이 공분산 행렬을 허용하여, q가 클 경우 일반적으로 발생하는 정규 공분산 추정의 수렴 경고 문제를 피할 수 있었다.
  • 정보 기준과 시각적 점검(예: 이중도)은 최적의 질량 d를 선택하는 데 효과적인 도구였으며, 해석의 질적 변화는 주로 낮은 d(예: d < 2)에서 발생하였다.
  • 이 방법은 glmmTMB의 기존 인터페이스와 호환성을 유지하여, 이전에 전용 GLVM 패키지에서 지원하지 못했던 다층, 반복 측정, 복잡한 표본 설계에 적용 가능하였다.
Figure 2: Conditional estimates (95% confidence interval) of the Zone by Year interaction terms for species from the diagonal random effect. The contrast between a zone (North, or South), and the Wind Farm zone in 2010 is shown.
Figure 2: Conditional estimates (95% confidence interval) of the Zone by Year interaction terms for species from the diagonal random effect. The contrast between a zone (North, or South), and the Wind Farm zone in 2010 is shown.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.