Juwon Song
Korea University · 情報科学
研究室紹介
Professor Juwon Song's research lab specializes in statistical data analysis and missing data methodologies, with a strong focus on advanced imputation techniques and cluster analysis for high-dimensional and incomplete datasets. The lab develops innovative methods such as hot-deck imputation with informed variable selection and cluster-informed missing value replacement to improve the accuracy and reliability of data analysis in social science and longitudinal studies. Their work emphasizes integrating domain-specific knowledge—such as partner risk perception in health behavior or demographic survey data—into statistical modeling to reduce bias and enhance analytical outcomes.
Research Overview
Research Output Trend
Figures are computed from collected data and may differ slightly.
Selected Papers
15Spatial join finds pairs of spatial objects having a specific spatial relationship in spatial database systems. Since spatial join is a fairly expensive operation, we need an efficient algorithm taking advantage of the characteristics of available spatial access methods. In this paper, we propose a spatial join algorithm using corner transformation and show its excellence through experiments. To the extent of authors' knowledge, the spatial join processing using corner transformation is new. In
Partner characteristics influence the condom use behavior of YMLH. YMLH make decisions regarding condom use based on perception of their partner's risk. Preventive interventions must include skills for acquiring accurate information about partner risk status and education regarding the health risks of unprotected sex with HIV seroconcordant partners.
군집분석은 유사한 특성을 지닌 관측치들을 동일한 그룹으로 분류하는 분석 기법이다. k-평균 군집분석은 관측치들과 군집 평균의 유클리디언 거리의 합을 최소화하는 그룹을 찾는 최적화 기법을 통해 자료를 군집으로 분류한다. 실제 자료의 경우 일부 변수에서 결측이 발생하는 경우가 흔하며 결측을 포함한 자료에 대하여 군집분석을 실시하는 경우 결측이 발생한 관측치를 제거한 후 분석을 실시하는 것이 일반적이다. 하지만 이 경우 결측이 발생한 자료는 어느 군집에도 할당할 수 없고 각 그룹의 평균의 추정에 편향이 발생할 가능성이 높다. 따라서 결측치를 포함한 자료를 군집분석에 포함하기 위하여 흔히 사용되는 방법은 결측값에 대해 대체를 실시한 후 대체된 자료에 대하여 군집분석을 실시하는데 이 경우 군집 정보를 포함하지 않고 대체를 실시하는 단점을 지닌다. 따라서 본 연구에서는 결측치에 대한 대체를 실시할 때 군집 정보를 이용하여 대체하는 방법을 제안한다. 모의실험을 통해 본 연구에서 제안한 방법을 군
결측자료에 대한 핫덱대체를 실시할 때 연관된 변수들을 가지고 대체군을 형성한 후 대체군 내에서 대체를 실시하는 것이 일반적이다. 대체군을 형성할 때 결측이 발생한 변수와 연관성이 있는 변수들을 모두 포함하여 대체군을 형성한다면 대체군을 형성하는 변수의 숫자가 늘어남에 따라 대체군의 개수도 기하급수적으로 늘어나게 되어 특정 대체군 내에서는 대체값을 제공할 기증자를 찾지 못하여 대체를 실시하지 못하는 문제가 발생하게 된다. 이를 해결하기 위하여 대체군을 형성하기 위한 변수를 선택해야 하는 문제에 종종 직명하게 된다. 본 연구에서는 핫덱대체에서 대체군을 형성하는 변수를 선택할 때 결측이 발생한 변수와의 연관성 뿐 아니라 결측 발생 여부와의 연관성도 고려하여 변수를 선택하는 것이 바람직하다는 점을 논의한다. 모의실험을 통해 제안된 방법에 의한 변수 선택을 실시하여 핫덱대체를 실시하는 경우 결측이 발생한 변수와의 연관성만을 고려한 변수 선택에 근거한 핫덱대체보다 추정량의 편향을 줄일 수 있다
Most survey data include missing values due to nonresponse. Especially, sensitive questions such as income or assets tend to show higher percentage of missing values. When missing values occur, complete-case analysis may lead to biased estimates in parameters. Korean Longitudinal Study of Aging(KLoSA) is a longitudinal study to evaluate aging trends in the Korean population and apply the results to the social welfare and labor policy. In 2006, KLoSA collected baseline data. We conduct multiple i
군집분석은 유사한 특성들을 지닌 관측값들을 같은 군집으로, 다른 특성들을 지닌 관측값들은 서로 다른 군집으로 분류하는 분석 기법이다. 많은 변수를 포함한 고차원 자료에서는 일반적인 군집분석 대신 차원축소를 통하여 군집분석을 실시하는 방법들이 제안되어 왔다. 주성분 분석을 통해 차원을 축소한 후 축소된 차원에서 군집분석을 실시하는 직렬분석 방법보다 차원축소와 군집분석을 결합하여 동시에 실시하는 방법들이 더 우수한 성능을 보인다는 것이 알려져 있다. 한편, 대부분의 자료는 결측값을 포함하고 있는데 결측값이 포함된 자료에 대하여 군집분석을 실시하는 경우 불완전하게 관측된 자료들은 어느 군집으로도 분류되지 않는 문제가 발생한다. 따라서 군집분석을 실시하기 전에 먼저 결측값 대체를 실시하는 것이 일반적이다. 본 연구에서는 고차원 결측자료에 대하여 차원축소를 통한 k-평균 군집분석을 실시할 때 결측값 대체를 결합하여 실시하는 방법을 제안한다. 이 방법은 군집 정보를 이용한 결측값 대체를 통해
무응답(nonresponse)을 포함한 설문 자료에 대한 대체 기법은 일반적으로 응답자가 한 개의 문항에 대해 한 개의 응답만 제공한다고 가정한다. 한편 선다형 문항에 대해 다중응답을 허락하는 경우 응답자는 한 개의 응답 대신 해당되는 항목들을 모두 선택할 수 있는데 이와 같은 다중응답 문항에서 발생하는 무응답에 대하여 대체를 실시하는 방법에 관한 연구는 제한적이다. 본 연구에서는 다중응답이 가능한 문항에서 발생한 무응답에 대하여 대체를 실시하는 세 가지 방법을 고려하였다. 첫 번째는 선다형 문항의 각 항목을 이항 변수로 변환한 후 각 이항 변수에 대해 독립적으로 대체를 실시하는 방법이고 두 번째는 가능한 응답 조합들을 고려하여 각 무응답을 적절한 응답 조합으로 대체하는 방법이며 세 번째는 공통 기증자 핫덱대체 방법이다. 모의실험을 통해 제안된 세 가지 방법들의 성능을 평가하였고 고령화연구패널 제 1차조사의 다중응답 문항에 대한 예제를 통해 실제 자료에 대한 적용 방법을 설명하였다.
결측자료의 분석에서 결측 비율은 분석의 질에 영향을 주는 주요 요소로 생각되어 왔다. 최근 결측 비율이 추정량의 편향에 영향을 주지 않는다는 연구 결과들이 발표되면서 결측 비율이 향상 분석의 질을 감소시키는 것은 아니라는 주장이 힘을 싣고 있다. 하지만 관련 연구들은 조사 자료에서 결측이 발생한 경우 모집단 평균을 추정하는데 결측 비율이 영향을 주는지를 논의하고 있으며 다른 분석에서의 영향을 평가한 연구는 찾기 힘들다. 군집분석은 자료 내 유사한 특성을 지닌 개체들을 동일한 군집으로 분류하는 분석기법으로 군집의 평균 추정보다는 적절한 분류를 실시하지 못하는 정도에 중점을 두고 분석이 실시되므로 조사 연구에서 모평균 추정과는 다른 문제로 접근하는 것이 필요하다. 본 연구에서는 군집분석 기법 중 하나인 k-평균 군집분석에 대하여 대체를 실시한 후 k-평균 군집분석을 시행할 때 결측 비율이 어떤 영향을 미치는 지 고찰하였다. 특히 k-평균 군집분석의 성능 및 결측자료의 성능과 연관된 요인
실제 자료는 여러 가지 원인으로 인하여 결측이 종종 발생하는데 결측값을 잘 예측할 수 있는 정보가 존재한다면 이를 활용하여 대체를 실시하는 게 바람직하다. 대규모 설문조사에서는 동일하거나 유사한 내용을 조사하는 여러 문항들이 사용되는 경우가 있고 동일한 정보를 측정한 행정자료나 다른 조사가 존재하기도 한다. 동일한 정보를 얻은 자료가 존재할 때 결측값 대체에서는 단순히 이 자료의 값으로 대체를 실시하는 게 일반적이지만 실제로 두 값은 정확히 동일하지 않은 경우가 많다. 본 연구에서는 결측이 발생한 관심 변수와 동일한 내용을 측정한 변수의 값이 일치하지 않는 경우 이를 측정오차를 포함한 관심변수의 불완전한 측정값이라 가정하고 이를 보정하는 대체 방법을 제안한다. 예제로 노동패널조사 22차 자료의 개인 작년 총근로소득에 결측이 발생하는 경우 작년에 응답한 월평균 근로소득으로부터 유추한 총근로소득으로 대체하는데 이 두 값들 사이에 차이가 존재하는 지 살펴보고 유추한 총근로소득을 조사에서
모수적 방법을 사용하여 대체(imputation)를 실시할 때 다변량 정규분포를 가정하는 경우가 흔하다. 실제 자료는 정규분포를 따르지 않는 범주형 변수들도 포함하는 경우가 많지만 범주형 변수와 연속형 변수의 결합밀도함수(joint density function)를 설정하기 어려워 범주형 변수들이 정규분포를 따르는 것처럼 가정한 채 대체를 실시하는 경우가 흔히 발생한다. 본 논문에서는 이항반응 변수는 연속형 정규분포를 가진 잠재변수(latent variable)의 이분된(dichotomized) 형태라고 가정한 후 잠재변수의 정규분포를 이용하여 다중대체를 시행하고 대체된 값을 결절점(cutpoint)을 이용하여 다시 이항반응을 가진 변수로 변환하는 방법을 제안하였다. 또한, 이 방법은 순서형 변수(ordinal variable) 및 명목형 변수(nominal variables)로 확장되어 연속형 변수와 함께 다변량 정규분포 하에서 대체를 실시하는 것이 가능하다. 모의실험을 통하여 제
Spatial access methods (SAMs) are often used as clustering indexes in spatial database systems. Therefore, a SAM should have the clustering property both in the index and in the data file. In this paper we argue that corner transformation preserves the clustering property such that objects having similar sizes and positions in the original space tend to be placed in the same region in the transform space. We then show that SAMs based on corner transformation are able to maintain clustering both
반복측정자료에서는 관측개체의 중도탈락 등의 원인으로 인하여 결측이 흔히 발생한다. 반복측정자료를 분석하기 위하여 동일한 개체에 대한 반복측정된 다른 시점의 값들 사이의 연관성을 포함하는 모형이 적합되는데 이 모형은 결측자료 하에서 정보의 손실이 없고 결측자료 메커니즘이 MAR(Little and Rubin, 2002)을 따른다면 모수의 추정에 편향(bias)이 발생하지 않는다고 알려져 있다. 반복측정자료의 분석에는 주요 관심 대상이 되는 변수 및 공변량 만을 모형에 포함시켜 분석하는 제한적 모형(restrictive model)이 흔히 사용되는데 이는 절약모형(parsimonious model)이 해석 및 설명하기 쉽기 때문이다. 반면, Collins, Schafer, and Kam(2001)은 횡단면 분석을 위한 모형에서 반응변수 및 결측 발생과 연관된 설명변수가 포함되지 않은 제한적 모형이 결측자료에 적용된다면 모수에 편향이 발생할 수 있다는 점을 모의실험을 통해 보였다. 본 연
가산형(count) 자료에 대한 분석은 포아송 분포를 가정하여 실시하는데 이 때 포아송 분포에서 기대하는 것보다 0의 값을 가진 관찰치가 많은 경우 영과잉 포아송 분포(zero-inflated Poisson distribution)를 가정하여 분석을 실시할 수 있다. Lambert(1992)는 영과잉 포아송 모형에 대하여 EM 알고리즘을 통한 모수 추정 방법을 제안하였다. 가산형 반응 변수에 결측이 발생하는 경우 결측자료 메커니즘이 MCAR이 아니라면 결측이 발생한 자료를 제외한 채 완전한 자료 만에 근거한 분석을 실시하면 모수의 추정에 편향이 발생할 수 있다. 본 연구에서는 영과잉 가산형 자료에 결측이 발생하는 경우 적용할 수 있는 모수 추정 방법으로서 MCEM 알고리즘을 통한 모수 추정 방법을 제안한다. 모의실험을 통해 영과잉 포아송 모형에서 결측이 발생하는 경우 결측자료 메커니즘이 MAR이라면 결측된 자료를 제외한 채 완전하게 응답된 자료 만에 근거한 분석은 편향이 발생할 수