[논문 리뷰] Variable subset selection via GA and information complexity in mixtures of Poisson and negative binomial regression models
이 논문은 과분산(count) 데이터에서 동질적 하위집단을 식별하기 위해 유한 혼합 모형(포isson 및 음이항 회귀 모형)을 제안하며, 유전 알고리즘(GA)과 정보 복잡도 기준(AIC, BIC, CAIC, ICOMP)을 활용한 변수 서브세트 선택 기법을 적용한다. 이 방법은 테네시 주 에이즈 감염자 수 데이터에서 네 개의 명확히 구분되는 하위집단을 성공적으로 식별하였으며, 주로 도시지역 여부와 비 히스패닉 백인 비율이 주요 예측변수로 작용하여 질병 부담의 공간적 이질성에 대한 통찰을 제공한다.
Count data, for example the number of observed cases of a disease in a city, often arise in the fields of healthcare analytics and epidemiology. In this paper, we consider performing regression on multivariate data in which our outcome is a count. Specifically, we derive log-likelihood functions for finite mixtures of regression models involving counts that come from a Poisson distribution, as well as a negative binomial distribution when the counts are significantly overdispersed. Within our proposed modeling framework, we carry out optimal component selection using the information criteria scores AIC, BIC, CAIC, and ICOMP. We demonstrate applications of our approach on simulated data, as well as on a real data set of HIV cases in Tennessee counties from the year 2010. Finally, using a genetic algorithm within our framework, we perform variable subset selection to determine the covariates that are most responsible for categorizing Tennessee counties. This leads to some interesting insights into the traits of counties that have high HIV counts.
연구 동기 및 목표
- 에pidemiological 연구에서 흔히 발생하는 과분산(count) 데이터를 다루기 위해, 유한 혼합 포isson 및 음이항 회귀 모형을 사용해 하위집단을 모델링함으로써 과분산 문제를 해결하고자 한다.
- 정보 기준(AIC, BIC, CAIC, ICOMP)을 활용해 유한 혼합 모형의 최적의 구성 요소 수를 체계적으로 식별하고자 한다.
- 유전 알고리즘(GA)을 활용한 변수 서브세트 선택을 통해, 카운티를 서로 다른 하위집단으로 분류하는 데 가장 영향력 있는 공변량(covariates)을 규명하고자 한다.
- 주관적인 구성 요소 수 선택을 피하고 공공보건 분석의 해석 가능성을 향상시키기 위해 데이터 기반의 모형 선택 접근법을 제공하고자 한다.
제안 방법
- 과분산(count) 데이터를 다루기 위해, 유한 혼합 포isson 및 음이항(NB-2) 회귀 모형의 로그우도 함수를 수립한다.
- 정보 복잡도 기준(AIC, BIC, CAIC, ICOMP)을 적용하여 모델의 최적 구성 요소 수를 객관적으로 선정한다.
- 테네시 주 에이즈 데이터셋의 8개 예측변수 중에서 가장 정보가 풍부한 공변량을 식별하기 위해 유전 알고리즘(GA)을 활용한 변수 서브세트 선택을 수행한다.
- 모형 복잡도를 보상하기 위해 ICOMP에서 역피셔 정보행렬(IFIM)을 사용하여 모형 선택 정확도를 향상시킨다.
- 선택된 변수를 포함한 유한 혼합 모형을 피팅하고, 구성 요소별 계수를 평가하여 하위집단 특성의 해석을 수행한다.
- 모의 데이터와 2010년 테네시 주 95개 카운티의 실제 데이터셋을 대상으로 본 방법의 유효성을 검증한다.
실험 결과
연구 질문
- RQ1정보 기준을 활용해 테네시 주 카운티의 에이즈 환자 수 기반으로 최적의 동질적 하위집단 수는 무엇이며, 이를 어떻게 결정하는가?
- RQ2변수 서브세트 선택을 통해 하위집단을 구분하는 데 가장 기여하는 공변량은 무엇인가?
- RQ3유한 혼합 모형에 의해 식별된 서로 다른 하위집단 간에서 공변량(예: 도시지역 여부, 인종/민족)의 효과는 어떻게 다름이 있는가?
- RQ4농촌과 도시 카운티 간의 사회경제 지표와 에이즈 유병률 간의 관계에서, 총인구 규모가 얼마나 혼란을 일으키는가?
- RQ5기본 포isson 또는 NB-2 회귀 모형에 비해 제안된 프레임워크가 과분산(count) 데이터에서 모형 적합도와 해석 가능성 측면에서 향상되는가?
주요 결과
- 최적의 유한 혼합 모형은 네 개의 구성 요소를 선택하여, 서로 다른 에이즈 환자 수 패턴을 보이는 네 개의 명확히 구분되는 하위집단이 존재함을 시사한다.
- 유전 알고리즘이 변수 4(도시지역 여부)와 변수 7(비 히스패닉 백인 비율)를 가장 자주 선택하여 강력한 예측 능력을 보임을 확인하였다.
- 변수 1, 3, 4, 5, 7(도시지역 여부 및 비 히스패닉 백인 비율 포함)를 포함한 모형이 가장 낮은 AIC(708.76), CAIC(776.89), SBC(756.89) 점수를 기록하여 최적의 적합도를 보였다.
- 네 개의 구성 요소 중 세 곳에서 비 히스패닉 백인 비율이 높은 수준에서 높은 에이즈 환자 수를 억제하는 보호적 요인로 작용하는 것으로 나타났으며, 도시지역 여부는 유의미한 위험 요인였다.
- 빈곤률, 실업률, 고등학교 이하 교육 수준은 구성 요소 간 내림세를 보였고, 도시지역 지표와 少수민족 비율은 증가하는 경향을 보여, 더 높은 에이즈 환자 수를 보이는 더 도시적이고 다양성이 높은 카운티로의 이동 경향을 반영한다.
- 최고의 에이즈 환자 수는 내슈빌, 멤피스, 노크스빌, 채터누아 등 주요 도시와 연관되어 있어, 질병 부담의 도시 집중 현상을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.