[논문 리뷰] Numerical Data Imputation for Multimodal Data Sets: A Probabilistic Nearest-Neighbor Kernel Density Approach
이 논문은 다중모드 및 복잡한 데이터 분포를 처리하기 위해 k-최근접 이웃(k-NN)과 커널 밀도 추정(KDE)을 조합한 새로운 데이터 보정 방법인 $k$NN×KDE를 제안한다. MCAR, MAR, MNAR 결손 상황에서 다양한 실재 및 시뮬레이션 데이터셋을 대상으로 기존 최고 수준의 방법들보다 더 낮은 보정 오차와 더 높은 가능도를 달성한다.
Numerical data imputation algorithms replace missing values by estimates to leverage incomplete data sets. Current imputation methods seek to minimize the error between the unobserved ground truth and the imputed values. But this strategy can create artifacts leading to poor imputation in the presence of multimodal or complex distributions. To tackle this problem, we introduce the $k$NN$ imes$KDE algorithm: a data imputation method combining nearest neighbor estimation ($k$NN) and density estimation with Gaussian kernels (KDE). We compare our method with previous data imputation methods using artificial and real-world data with different data missing scenarios and various data missing rates, and show that our method can cope with complex original data structure, yields lower data imputation errors, and provides probabilistic estimates with higher likelihood than current methods. We release the code in open-source for the community: https://github.com/DeltaFloflo/knnxkde
연구 동기 및 목표
- 다중모드 및 복잡한 데이터 분포를 다루는 데 있어 전통적 보정 방법의 한계를 해결하기 위해.
- 밀도 추정을 통해 불확실성 모델링을 통해 원래 데이터 구조를 유지하는 방법을 개발하기 위해.
- 최소 제곱 오차 최소화를 넘어서 확률적 가능도를 평가 지표로 활용하여 보정 정확도를 향상시키기 위해.
- 실세계의 완성되지 않은 데이터셋에서 수치형 데이터 보정을 위한 실용적이고 확장 가능하며 오픈소스 솔루션을 제공하기 위해.
- 다양한 결손 데이터 메커니즘(MCAR, MAR, MNAR)과 데이터 유형(표 형태 및 고차원 데이터 포함)에서 성능을 평가하기 위해.
제안 방법
- 해당 방법은 결손 값이 있는 타겟 샘플과 가장 유사한 k개의 인스턴스를 k-NN을 통해 식별한다.
- 각 결손 특성에 대해, k-NN 이웃을 대상으로 가우시안 커널 밀도 추정(KDE)을 사용해 조건부 밀도를 추정한다.
- 추정된 조건부 밀도에서 샘플링을 통해 보정 값을 도출함으로써 점 추정치가 아닌 확률적 보정을 가능하게 한다.
- 지역 이웃 구조와 커널 스무딩을 활용하여 관측된 특성과 결손된 특성을 동시에 모델링한다.
- 추정된 밀도를 사용해 가능도 점수를 계산하여 NRMSE를 초월한 보정 품질 평가를 수행한다.
- 이 접근법은 오픈소스 코드로 구현되었으며, 다양한 결손률과 결손 메커니즘을 가진 14개의 다양한 데이터셋에서 평가되었다.

실험 결과
연구 질문
- RQ1하이브리드 k-NN 및 KDE 접근법이 다중모드 데이터 분포에서 기존 보정 방법보다 보정 정확도에서 뛰어나게 성능을 발휘할 수 있는가?
- RQ2제안된 $k$NN×KDE 방법은 다양한 결손 데이터 메커니즘(MCAR, MAR, MNAR)에서 어떻게 성능을 발휘하는가?
- RQ3밀도 추정을 통한 확률적 보정은 k-NN-Imputer나 MissForest와 같은 점 추정 방법보다 더 높은 가능도 점수를 제공하는가?
- RQ4이 방법은 고차원 및 이질적인 표 형태 데이터셋에서 복잡한 구조를 가진 데이터에 대해 어떻게 확장 가능한가?
- RQ5기존 최고 수준의 보정 기법들보다 진정한 원천 데이터 분포를 더 잘 유지할 수 있는가?
주요 결과
- $k$NN×KDE 방법은 MCAR, MAR, MNAR 상황에서 모든 데이터셋에서 가장 낮은 정규화된 RMSE(NRMSE)를 기록했으며, 게이저 데이터셋에서는 평균 NRMSE가 0.35 ± 0.076(산호어류), 0.44 ± 0.037(레드와인)를 기록했다.
- 로그 가능도 평가에서 $k$NN×KDE는 모든 베이스라인을 뛰어넘는 성능을 보였다: 산호어류(MCAR)에서 평균 로그 가능도 2.08 ± 0.024, 산호어류(MAR)에서 2.09 ± 0.021를 기록했으며, MissForest는 -2.40 ± 0.206을 기록했다.
- 지열 분포 데이터셋에서 $k$NN×KDE는 MCAR 시나리오에서 로그 가능도 0.83 ± 0.098, MAR 시나리오에서 0.82 ± 0.070을 기록했으며, MICE(-11.39 ± 0.122)와 MissForest(-4.49 ± 0.208)를 모두 압도했다.
- 고차원 데이터에 대해서도 강인한 성능을 보였으며, 산호어류 데이터셋(30개 특성)에서 MCAR 조건에서 로그 가능도 1.53 ± 0.063을 기록했고, MICE는 3.42 ± 0.142를 기록했다.
- MNAR 상황에서도 $k$NN×KDE는 강력한 성능을 유지했으며, 산호어류 데이터셋에서 평균 로그 가능도 1.47 ± 0.075를 기록했고, MissForest(1.87 ± 0.356)와 MICE(3.40 ± 0.167)를 모두 뛰어넘었다.
- 비선형 분포가 복잡한 경우, 예를 들어 2D 링 또는 사인 패턴에서, $k$NN×KDE는 MCAR 시나리오에서 로그 가능도 0.31 ± 0.043, MAR 시나리오에서 0.31 ± 0.056를 기록했으며, k-NN-Imputer와 MICE를 크게 앞서는 성능을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.