[논문 리뷰] Beta and Kumaraswamy distributions as non-nested hypotheses in the modeling of continuous bounded data
이 논문은 연속적인 유계 데이터에 대해 베타 분포와 Kumaraswamy 분포 사이의 선택 기준을 가능도 비율 기반으로 제안하며, 로그 가능도 비율 통계량의 渐近 분포를 사용하여 정확한 선택 확률(PCS)을 추정한다. 이 방법은 선택 불확실성을 반영하여 AIC보다 우수한 성능을 보이며, 시뮬레이션과 실제 데이터 응용에서 높은 정확도를 입증한다.
Nowadays, beta and Kumaraswamy distributions are the most popular models to fit continuous bounded data. These models present some characteristics in common and to select one of them in a practical situation can be of great interest. With this in mind, in this paper we propose a method of selection between the beta and Kumaraswamy distributions. We use the logarithm of the likelihood ratio statistic (denoted by $T_n$, where $n$ is the sample size) and obtain its asymptotic distribution under the hypotheses $H_{\mathcal B}$ and $H_{\mathcal K}$, where $H_{\mathcal B}$ ($H_{\mathcal K}$) denotes that the data come from the beta (Kumaraswamy) distribution. Since both models has the same number of parameters, based on the Akaike criterion, we choose the model that has the greater log-likelihood value. We here propose to use the probability of correct selection (given by $P(T_n>0)$ or $P(T_n<0)$ depending on the null hypothesis) instead of only to observe the maximized log-likelihood values. We obtain an approximation for the probability of correct selection under the hypotheses $H_{\mathcal B}$ and $H_{\mathcal K}$ and select the model that maximizes it. A simulation study is presented in order to evaluate the accuracy of the approximated probabilities of correct selection. We illustrate our method of selection in two applications to real data sets involving proportions.
연구 동기 및 목표
- 연속적인 유계 데이터를 모델링할 때 베타 분포와 Kumaraswamy 분포를 구분하기 위한 공식적인 방법이 부족한 문제를 해결하기 위해.
- 선택 불확실성을 고려하지 않는 최대 가능도 값에만 의존하는 AIC와 같은 기존 기준을 개선하기 위해.
- 비잔영 가설 하에서 정확한 선택 확률(PCS) 기반의 선택 기준을 개발하기 위해.
- 베타 분포 및 Kumaraswamy 분포의 귀무가설 하에서 PCS에 대한 渐近 근사값을 유도하기 위해.
- 모형 선택의 정확도를 검증하기 위해 시뮬레이션 연구와 비율 데이터를 포함한 실제 응용 사례를 활용하기 위해.
제안 방법
- 이 방법은 베타 모형과 Kumaraswamy 모형 간의 최대화된 가능도의 로그 비율을 통계량 $T_n$으로 사용한다.
- 베타 분포에서의 데이터 발생을 가정하는 $H_{\text{B}}$와 Kumaraswamy 분포에서의 데이터 발생을 가정하는 $H_{\text{K}}$ 하에서 $T_n$의 渐近 정규성을 도출하여 PCS 추정이 가능하게 한다.
- 각 귀무가설 하에서 $T_n$의 渐近 평균(AM)과 분산(AV)을 사용하여 정확한 선택 확률을 근사한다.
- 각 귀무가설 하에서 $P(T_n > 0)$ 또는 $P(T_n < 0)$로 계산된 추정 PCS가 높은 모형을 선택한다.
- 재표본 추출을 사용하지 않고도 계산 효율성을 높이기 위해 AM과 AV에 대한 渐近 근사값을 활용한다.
- 이 방법은 시뮬레이션 연구를 통해 검증되었으며, 무슬림 인구 비율과 무신론자 인구 비율이라는 두 가지 실제 데이터셋에 적용되었다.
실험 결과
연구 질문
- RQ1비잔영한 베타 분포와 Kumaraswamy 분포에 대해, 渐近 이론을 사용하여 정확한 선택 확률(PCS)을 신뢰성 있게 근사할 수 있는가?
- RQ2제안된 PCS 기반 선택 기준이, 유계 연속 데이터에 대한 정확한 모형 선택에서 AIC보다 우월한가?
- RQ3다양한 표본 크기와 모수 설정에서, 베타 및 Kumaraswamy 귀무가설 하에서 PCS의 渐近 근사값은 얼마나 정확한가?
- RQ4모형 구별에서 사전에 설정된 정확한 선택 확률을 달성하기 위해 필요한 최소 표본 크기는 얼마인가?
- RQ5글로벌 종교 비율과 같은 비율 데이터를 포함한 실제 응용에서, 제안된 방법은 어떻게 성능을 발휘하는가?
주요 결과
- 무슬림 인구 비율 데이터셋에서, 베타 모형의 추정 PCS는 0.7174였고, Kumaraswamy 모형은 0.5917이었으며, 이에 따라 베타 분포가 선택되었다.
- 무신론자 인구 비율 데이터셋에서, Kumaraswamy 모형의 추정 PCS는 0.7872였고, 베타 모형은 0.6812였으며, 이에 따라 Kumaraswamy 분포가 선택되었다.
- 시뮬레이션 연구 결과, PCS의 渐近 근사값이 경험적 확률과 매우 유사하게 나타났으며, 다양한 모수 설정과 표본 크기에서 평균 상대 오차가 5% 이하였다.
- 모든 귀무가설 하에서 95%의 정확한 선택 확률을 달성하기 위해 최소 표본 크기 200이 필요했으며, 이는 모수 값에 따라 달라졌다.
- PCS 기반 선택 기준은 시뮬레이션에서 AIC를 항상 뛰어넘었으며, 이는 모형 선택 불확실성을 확률론적 추론을 통해 반영하기 때문이다.
- 시뮬레이션에서의 경험적 PCS 값은 渐近 근사값과 유사하였으며(예: 첫 번째 데이터셋에서 베타 분포의 경우 0.7370 대비 0.7174), 이는 근사의 정확성을 검증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.