[논문 리뷰] Multiple imputation of multilevel missing data: An introduction to the R package pan
이 논문은 다수의 누락된 다수 수준 데이터에 대한 다중 보정을 위한 R 패키지 pan을 소개하며, 접근성을 높이기 위해 mitml 패키지를 활용하여 그 사용법을 설명한다. 다중 보정 과정에서 다수 수준 구조를 고려할 경우, 리스트와이즈 삭제나 단일 수준 보정에 비해 다수 수준 모형 추정치의 편향을 줄이며 타당한 통계적 추론을 유지함을 보여준다.
The treatment of missing data can be difficult in multilevel research because state-of-the-art procedures such as multiple imputation (MI) may require advanced statistical knowledge or a high degree of familiarity with certain statistical software. In the missing data literature, pan has been recommended for MI of multilevel data. In this article, we provide an introduction to MI of multilevel missing data using the R package pan, and we discuss its possibilities and limitations in accommodating typical questions in multilevel research. To make pan more accessible to applied researchers, we make use of the mitml package, which provides a user-friendly interface to the pan package and several tools for managing and analyzing multiply imputed data sets. We illustrate the use of pan and mitml with two empirical examples that represent common applications of multilevel models, and we discuss how these procedures may be used in conjunction with other software.
연구 동기 및 목표
- 응용 연구에서 자주 간과되는 다수 수준 데이터에 대한 다중 보정(MI) 적용의 과제를 해결하기 위해.
- 비전문가 R 사용자를 위한 pan 패키지의 기술적 복잡성으로 인한 장벽을 극복하기 위해.
- pan과 mitml 패키지의 통합을 통해 다중 보정된 다수 수준 데이터셋의 보정, 진단, 분석를 간편화하기 위해.
- 다수 수준 효과(예: 그룹 내 및 그룹 간 효과, 랜덤 기울기)를 보정 과정에서 적절히 다루어 편향된 추정치를 방지하기 위해.
- 복수의 다중 보정된 데이터셋에서 결과를 융합하기 위한 Rubin의 규칙과 복잡한 가설 검정을 위한 대안 방법(D1, D2, D3)에 대한 실용적 지침을 제공하기 위해.
제안 방법
- 클러스터링과 랜덤 효과를 고려한 다수 수준 혼합 모형(MLMM)을 사용하여 pan 패키지를 통해 다수 수준 다중 보정을 수행한다.
- mitml 패키지를 pan의 사용자 友好的 인터페이스로 활용하여 구조화된 보정 워크플로우와 자동 수렴 진단을 지원한다.
- 학생 수준 예측변수를 그룹 평균 주위로 중심화하여 다수 수준 모형에서 그룹 내 및 그룹 간 효과를 분리한다.
- 보조 변수를 보정 모형에 포함하고 다수 수준 구조를 유지함으로써 분석 모형과의 호환성을 확보한다.
- Rubin의 규칙과 대안 방법(D1, D2, D3)을 적용하여 복수의 다중 보정된 데이터셋 간의 모수 추정치를 융합하고 가설을 검정한다.
- 다중 보정된 데이터에 적합한 융합 절차를 사용하여 모형 비교 및 제약 조건(예: 회귀 계수의 동일성) 검정을 수행한다.
실험 결과
연구 질문
- RQ1다수 수준 구조를 유지하면서 다수 수준 데이터에 대한 다중 보정을 효과적으로 적용할 수 있는 방법은 무엇인가? 이는 모수 추정치의 편향을 방지하는 데 기여하는가?
- RQ2pan 패키지를 사용한 다수 수준 MI에서 발생하는 실용적 과제는 무엇이며, mitml 패키지는 응용 연구자들에게 접근성을 어떻게 향상시키는가?
- RQ3보정 과정에서 다수 수준 구조를 忽略할 경우, 다수 수준 모형에서 그룹 내 및 그룹 간 효과의 추정에 어떤 영향을 미치는가?
- RQ4다양한 모수를 포함한 복잡한 가설 검정을 위한 다중 보정된 다수 수준 데이터셋의 결과 융합을 위한 방법은 무엇인가?
- RQ5랜덤 기울기 모형의 예측변수에서 누락 데이터가 발생할 경우, 현재의 다수 수준 MI 접근법의 한계는 무엇인가? 이는 향후 방법론적 발전이 필요한가?
주요 결과
- 적절한 다수 수준 보정 모형을 사용하여 pan을 적용할 경우, 리스트와이즈 삭제나 단일 수준 보정에 비해 다수 수준 모형 추정치의 편향을 크게 줄일 수 있다.
- mitml 패키지는 pan의 효율적이고 사용자 友好的한 구현을 가능하게 하며, 다중 보정된 데이터셋 간의 수렴 진단 및 융합 결과 지원을 제공한다.
- 그룹 수준 구조를 유지하면서 다수 수준 데이터를 보정할 경우, 특히 랜덤 절편과 기울기를 포함한 모형에서 고정 효과 및 랜덤 효과의 추정치가 더 정확해진다.
- 보정 모형에 보조 변수를 포함시키면 추정 효율성이 향상되고 다수 수준 관계의 무결성이 유지된다.
- D1, D2, D3와 같은 융합 절차를 통해 복잡한 가설, 예를 들어 모형 비교나 모수 제약 조건 검정에 대한 타당한 추론이 복수의 다중 보정된 데이터셋 간에 가능하다.
- 다른 발전에도 불구하고, 적합도 지표(AIC, BIC 등) 추정 및 랜덤 기울기 모형의 예측변수에서의 누락 데이터 처리 문제는 여전히 도전 과제이며, 향후 방법론적 발전이 필요함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.