Skip to main content
QUICK REVIEW

[논문 리뷰] Variance partitioning in multilevel models for count data

George Leckie, William J. Browne|arXiv (Cornell University)|2019. 11. 15.
Statistical Methods and Bayesian Inference참고 문헌 20인용 수 5
한 줄 요약

이 논문은 과분산이 존재하는 다수준 모형을 위한 정확한 분산 분할 계수(VPC)와 집단내상관계수(ICC)를 개발한다. 기존의 포아송 모형에 대한 연구를 더 유연한 음수이항분포, 세 수준, 랜덤 계수 모형으로 확장한다. 총 분산을 군집 간 및 군집 내 성분으로 분할하는 대수적 표현을 제공하여, 학생 결석과 같은 과분산된 카운트 결과에서 군집 효과를 정량화할 수 있도록 한다.

ABSTRACT

A first step when fitting multilevel models to continuous responses is to explore the degree of clustering in the data. Researchers fit variance-component models and then report the proportion of variation in the response that is due to systematic differences between clusters. Equally they report the response correlation between units within a cluster. These statistics are popularly referred to as variance partition coefficients (VPCs) and intraclass correlation coefficients (ICCs). When fitting multilevel models to categorical (binary, ordinal, or nominal) and count responses, these statistics prove more challenging to calculate. For categorical response models, researchers appeal to their latent response formulations and report VPCs/ICCs in terms of latent continuous responses envisaged to underly the observed categorical responses. For standard count response models, however, there are no corresponding latent response formulations. More generally, there is a paucity of guidance on how to partition the variation. As a result, applied researchers are likely to avoid or inadequately report and discuss the substantive importance of clustering and cluster effects in their studies. A recent article drew attention to a little-known exact algebraic expression for the VPC/ICC for the special case of the two-level random-intercept Poisson model. In this article, we make a substantial new contribution. First, we derive exact VPC/ICC expressions for more flexible negative binomial models that allows for overdispersion, a phenomenon which often occurs in practice. Then we derive exact VPC/ICC expressions for three-level and random-coefficient extensions to these models. We illustrate our work with an application to student absenteeism.

연구 동기 및 목표

  • 과분산이 존재할 경우 다수준 카운트 데이터 모형에 대해 신뢰할 수 있는 분산 분할 방법의 부족을 해결하기 위해.
  • 이전에 선형 및 이진 모형에 국한되어 있던 기존의 분산 분할 기법을 잠재변수 가정에 의존하지 않고 카운트 반응 변수 영역으로 확장하기 위해.
  • 카운트 데이터를 위한 더 복잡한 다수준 구조, 특히 세 수준 및 랜덤 계수 모형에서 정확한 대수적 표현을 유도하기 위해.
  • 응용 연구자들이 군집 효과의 실질적 중요성을 평가할 수 있도록 실용적인 도구를 제공하기 위해.
  • 실제 응용 사례를 통해 방법을 설명하기 위해, 학생 결석에 관한 실세계 데이터를 활용하여 공중보건 및 사회과학 연구에서의 유용성을 입증하기 위해.

제안 방법

  • 과분산을 고려한 두 수준 랜덤 절편 음수이항분포 모형에 대해 정확한 분산 분할 계수(VPC)와 집단내상관계수(ICC)를 유도한다.
  • 다수준 카운트 데이터를 위한 세 수준 다수준 모형으로 유도를 확장하여, 다중 계층 수준에서의 분산 분할을 가능하게 한다.
  • 음수이항분포 모형의 랜덤 계수(랜덤 기울기) 확장에 대해 VPC 및 ICC 표현식을 유도하여 군집별로 다른 효과를 수용한다.
  • 음수이항분포의 주변 분산 구조에 기반한 정확한 대수적 표현을 사용하여 고차원 군집에 기인한 총 분산의 비율을 계산한다.
  • 실제 학생 결석 데이터셋에 방법을 적용하여, 실무에서 VPC 및 ICC의 계산 및 해석 방법을 시연한다.
  • 모형 유형 간 결과를 비교하여 이론적 기대와 일관성을 보여주는 방식으로 접근의 타당성을 검증한다.

실험 결과

연구 질문

  • RQ1과분산이 존재할 경우 다수준 카운트 데이터 모형에서 분산을 어떻게 분할할 수 있는가?
  • RQ2카운트 결과가 있는 세 수준 다수준 모형에서 VPC 및 ICC의 정확한 대수적 표현은 무엇인가?
  • RQ3음수이항분포 모형의 랜덤 계수 확장은 카운트 데이터에서 분산을 어떻게 분할하는 데 사용될 수 있는가?
  • RQ4군집 효과가 카운트 데이터의 총 분산에 미치는 영향은 무엇이며, 이를 어떻게 의미 있게 정량화할 수 있는가?
  • RQ5이러한 분산 분할 기법은 실세계의 공중보건 및 사회과학 연구에서 어떻게 적용되고 해석될 수 있는가?

주요 결과

  • 과분산된 카운트 데이터에서 군집 효과를 정밀하게 정량화할 수 있도록, 두 수준 랜덤 절편 음수이항분포 모형에 대해 정확한 VPC 및 ICC 표현식을 도출하였다.
  • 이 방법은 세 수준 다수준 모형으로도 성공적으로 확장되어, 카운트 데이터에서 다중 계층 수준에서의 분산 분할을 가능하게 하였다.
  • 군집별 기울기(클러스터 특화 기울기)를 수용할 수 있도록, 랜덤 계수 음수이항분포 모형에 대한 VPC 및 ICC 표현식을 도출하였다.
  • 학생 결석 데이터에 대한 적용 사례는 결석 빈도의 상당한 비율이 학교 수준의 군집에 기인해 있음을 시사하며, 맥락적 효과의 중요성을 강조한다.
  • 유도된 표현식은 잠재변수 근사에 의존하지 않는 정확한 대수적 표현이므로 이전의 수단적 접근보다 더 신뢰할 수 있다.
  • 과분산을 忽시하거나 잘못된 분산 분할 기법을 사용할 경우 카운트 데이터에서 군집 효과의 해석이 오해의 소지가 있음을 결과가 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.