Skip to main content
QUICK REVIEW

[논문 리뷰] Extending Growth Mixture Models Using Continuous Non-Elliptical Distributions

Yuhong Wei, Yang Tang|arXiv (Cornell University)|2017. 03. 25.
Statistical Methods and Bayesian Inference참고 문헌 43인용 수 7
한 줄 요약

이 논문은 성장 혼합 모형(GMMs)을 확장하여 연속적인 비타원형 분포—특히 다변량 비대칭 t분포와 일반화된 초구형 분포—를 도입함으로써 비대칭성과 무거운 尾를 가지는 종단적 자료를 더 잘 모형화한다. 정규 분포 혼합 구조와 일반화된 역가우스 분포를 활용해 무작위 효과와 측정 오차를 이러한 유연한 분포로 모형화함으로써 제안된 GHD-GMM 및 GST-GMM 모형은 비정규성 하에서 기존의 가우시안 GMM에 비해 모형 적합도를 크게 향상시키고 임의의 클래스 추출 위험을 감소시킨다.

ABSTRACT

Growth mixture models (GMMs) incorporate both conventional random effects growth modeling and latent trajectory classes as in finite mixture modeling; therefore, they offer a way to handle the unobserved heterogeneity between subjects in their development. GMMs with Gaussian random effects dominate the literature. When the data are asymmetric and/or have heavier tails, more than one latent class is required to capture the observed variable distribution. Therefore, a GMM with continuous non-elliptical distributions is proposed to capture skewness and heavier tails in the data set. Specifically, multivariate skew-t distributions and generalized hyperbolic distributions are introduced to extend GMMs. When extending GMMs, four statistical models are considered with differing distributions of measurement errors and random effects. The mathematical development of GMMs with non-elliptical distributions relies on their expression as normal variance-mean mixtures and the resultant relationship with the generalized inverse Gaussian distribution. Parameter estimation is outlined within the expectation-maximization framework before the performance of our GMMs with non-elliptical distributions is illustrated on simulated and real data.

연구 동기 및 목표

  • 비대칭성과 중간 꼬리가 있는 비정규 종단적 자료를 다룰 수 없는 가우시안 GMM의 한계를 해결한다.
  • 연속적인 비타원형 분포를 활용한 민감한 GMM 확장 모형을 개발하여 모형 적합도를 향상시키고 임의의 클래스 탐지 위험을 줄인다.
  • 이질성, 비대칭성, 중간 꼬리 오차 구조 하에서 성장 궤적과 클래스 소속의 정확한 추정을 가능하게 한다.
  • 정규 분포 혼합 구조 내에서 EM 알고리즘을 활용한 매개변수 추정을 위한 통계적으로 타당한 프레임워크를 제공한다.
  • 정규성 가정 위반 시 시뮬레이션 및 실제 자료에서 비타원형 GMM이 가우시안 GMM보다 뛰어난 성능을 보임을 입증한다.

제안 방법

  • 무작위 효과와 측정 오차에 일반화된 초구형 분포와 다변량 비대칭 t분포를 도입하여 기존 GMM을 확장함으로써 GHD-GMM 및 GST-GMM 모형을 제안한다.
  • 이 분포들의 정규 분포 혼합 구조를 활용하며, 혼합 분산은 일반화된 역가우스(GIG) 분포를 따른다.
  • 정규 분포 혼합의 계층적 구조를 이용해 가능도를 설정함으로써 EM 기반의 매개변수 추정을 가능하게 한다.
  • 네 가지 모형 변종을 구현: 비대칭성 파rameter가 자료 공간 또는 성장 요인 공간에 위치한 경우에 대한 GHD-GMM 및 GST-GMM.
  • 혼합 구조에서 유도된 조건부 분포를 활용하여 EM 알고리즘을 적용해 모형 매개변수를 추정한다.
  • 최적의 잠재 클래스 수 선택과 경쟁 모형 간의 모형 적합도 비교를 위해 베이지안 정보 기준(BIC)을 사용한다.

실험 결과

연구 질문

  • RQ1비타원형 분포를 갖는 GMM은 비정규 종단적 자료의 비대칭성과 중간 꼬리 문제를 가우시안 GMM보다 더 잘 포착할 수 있는가?
  • RQ2비대칭 t분포와 일반화된 초구형 분포의 포함 여부가 비정규성 하에서 클래스 수 결정과 모형 적합도에 어떤 영향을 미치는가?
  • RQ3자료 공간에 비대칭성 파rameter를 두는 것과 성장 요인 공간에 두는 것 중 어느 것이 더 해석 가능하고 효율적인 모형을 제공하는가?
  • RQ4비정규 오차 분포로 인한 임의의 잠재 클래스 탐지 위험을 어느 정도 감소시킬 수 있는가?
  • RQ5실제 심리학적 및 생물통계학적 적용에서 정규성 가정을 위반하는 자료에 대해 제안된 모형이 가우시안 GMM의 강력한 대안이 될 수 있는가?

주요 결과

  • 비정규 무작위 효과를 가진 시뮬레이션 1에서, 가우시안 GMM은 클래스 수를 과대평가했다(4개 클래스일 경우 67%, 5개일 경우 33%); 반면 제안된 GHD-GMM 및 GST-GMM 모형은 100%의 경우에서 두 개의 클래스를 정확히 식별했다.
  • 비정규 측정 오차를 가진 시뮬레이션 2에서, 가우시안 GMM은 다시 클래스 수를 과대평가했다(3개 클래스일 경우 24%, 4개일 경우 57%); 반면 제안된 모형들(모델 II 및 IV)은 100%의 경우에서 두 개의 클래스를 정확히 선택했다.
  • 두 시뮬레이션 모두에서 BIC는 제안된 GHD-GMM 및 GST-GMM 모형(모델 I 및 II)을 가우시안 GMM 및 다른 모형 사양보다 항상 선호했다.
  • 자료 공간에 비대칭성 파rameter를 두는 모형(GHD-GMM, β_ηk = 0 하에서)은 더 해석 가능했고, 성장 요인 공간에 비대칭성 파rameter를 두는 모형(GHD-GMM, β_yk = 0 하에서)은 파라미터 수가 적고 더 단순한 모형이었다.
  • 일반화된 초구형 분포 가족은 비대칭 t분포, 분산-감마 분포, 정규-역가우스 분포를 특수한 경우로 포함하여 다양한 자료 구조에 대한 모형의 유연성을 향상시킨다.
  • 비정규 결과를 보이는 실제 자료(예: 체질량지수(BMI) 발달)에 대해 제안된 모형은 비정규성으로 인한 잠재 클래스 추출 위험을 줄여 가우시안 GMM보다 더 뛰어난 적합도를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.