[논문 리뷰] A Copula-based Imputation Model for Missing Data of Mixed Type in Multilevel Data Sets
이 논문은 연속형, 순서형, 명목형 변수 유형을 혼합한 다수준 자료에 대해 무작위 효과를 포함하여 군집화를 고려한 코풀라 기반 보정 모델을 제안한다. 잠재 변수 프레임워크와 확장된 순위 우도, 게이브스 샘플링을 사용하여 기존 방법에 비해 보정 정확도와 모수 복원도가 향상되며, 특히 내부 상관계수가 높을 경우에 유의미한 개선을 보인다.
We propose a copula based method to handle missing values in multivariate data of mixed types in multilevel data sets. Building upon the extended rank likelihood of \cite{hoff2007extending} and the multinomial probit model, our model is a latent variable model which is able to capture the relationship among variables of different types as well as accounting for the clustering structure. We fit the model by approximating the posterior distribution of the parameters and the missing values through a Gibbs sampling scheme. We use the multiple imputation procedure to incorporate the uncertainty due to missing values in the analysis of the data. Our proposed method is evaluated through simulations to compare it with several conventional methods of handling missing data. We also apply our method to a data set from a cluster randomized controlled trial of a multidisciplinary intervention in acute stroke units. We conclude that our proposed copula based imputation model for mixed type variables achieves reasonably good imputation accuracy and recovery of parameters in some models of interest, and that adding random effects enhances performance when the clustering effect is strong.
연구 동기 및 목표
- 연속형, 순서형, 명목형 변수 유형을 혼합한 다수준 자료에서 군집화 구조를 고려하여 결측치를 다루는 것.
- Hoff(2007)의 코풀라 기반 확장된 순위 우도를 다수준 군집 간 상관관계를 고려한 무작위 효과를 포함하도록 확장하는 것.
- 잠재 변수 프레임워크에 다항 프로빗 모델을 적용하여 명목형 변수를 처리하는 모델을 개발하는 것.
- 시뮬레이션과 뇌졸중 치료 임상시험의 실제 자료를 활용하여 보정 정확도와 모수 복원도를 평가하는 것.
- 다수준 자료에서 군집 효과가 뚜렷할 경우 무작위 효과를 포함하는 것이 어떤 이점이 있는지 보여주는 것.
제안 방법
- 관측된 혼합 유형 변수를 표준 정규 분포로 변환하기 위해 역정규 CDF를 사용하는 잠재 변수 모델을 사용한다.
- 변수 간 의존성을 가우시안 코풀라 구조를 사용하여 모델링하기 위해 확장된 순위 우도(Hoff, 2007)를 적용한다.
- 군집 수준에서 다변량 정규 분포를 사용하여 무작위 효과를 도입하여 군집 내 상관관계를 포착한다.
- 이산적이고 순서가 없는 카테고리 유형을 처리하기 위해 잠재 공간에서 다항 프로빗 모델을 사용하여 명목형 변수를 모델링한다.
- 모수 및 결측치의 사후분포를 근사하기 위해 게이브스 샘플링 알고리즘을 사용한다.
- 결측치에서 유래한 불확실성을 후속 분석에 전파하기 위해 다중 보정을 활용한다.
실험 결과
연구 질문
- RQ1코풀라 기반 보정 모델은 다수준 자료에서 연속형, 순서형, 명목형 변수를 효과적으로 다룰 수 있는가?
- RQ2군집화가 존재할 경우 무작위 효과를 포함함으로써 보정 정확도가 어떻게 향상되는가?
- RQ3기존 보정 방법(예: 평균 보정, 공동 모델링)에 비해 제안된 모델은 모수 복원도 측면에서 어떻게 비교되는가?
- RQ4변수 분포가 정규분포에서 벗어날 경우에도 모델의 성능이 유지되는가?
- RQ5실제 다수준 임상시험 자료에서 결측치가 존재할 경우 모델은 치료 효과를 얼마나 잘 복원하는가?
주요 결과
- 코풀라 기반 보정 모델은 관심 있는 모델에서 합리적인 수준의 보정 정확도와 진짜 모수의 효과적인 복원을 달성하였다.
- 내부 상관계수(ICC)가 높을 경우 무작위 효과를 포함함으로써 성능 향상이 뚜렷하게 향상되었으며, 특히 군집 수준 효과 복원에 유의미한 개선이 있었다.
- 비정규 분포 조건에서도 기존 방법에 비해 모델이 뛰어난 성능을 보이며 정규성에서의 이탈에 대해 강건함을 입증하였다.
- QASC 임상시험 자료에서는 혼합 유형 변수에 대해 중간에서 높은 결측률(최대 17%)을 효과적으로 처리하면서 다수준 구조를 유지하였다.
- 다중 보정 하에서 신체적 및 정신건강 점수에 대한 치료 효과 추정치는 안정적이고 정밀하였으며, 각 보정 결과에서 p-값과 신뢰구간이 일관성을 보였다.
- 적합도 고려사항에 따르면, 비록 가우시안 코풀라가 계산적으로 유리하지만, 일부 경우에서 꼬리 의존성을 포착하기 위해 보다 다른 코풀라(예: t-코풀라)가 필요할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.