[논문 리뷰] An approach to dealing with missing values in heterogeneous data using k-nearest neighbors
이 논문은 날것, 간격, 흐린 값들을 처리하기 위해 맞춤형 거리 측도를 사용하는 k-최근접 이웃(k-NN) 보간 방법을 제안한다. 이는 작고 이질적인 데이터셋에서 낮은 평균제곱오차(MSE)를 달성하여, 혼합된 데이터 유형에서조차도 강건한 성능을 보인다.
Techniques such as clusterization, neural networks and decision making usually rely on algorithms that are not well suited to deal with missing values. However, real world data frequently contains such cases. The simplest solution is to either substitute them by a best guess value or completely disregard the missing values. Unfortunately, both approaches can lead to biased results. In this paper, we propose a technique for dealing with missing values in heterogeneous data using imputation based on the k-nearest neighbors algorithm. It can handle real (which we refer to as crisp henceforward), interval and fuzzy data. The effectiveness of the algorithm is tested on several datasets and the numerical results are promising.
연구 동기 및 목표
- 실제 데이터셋에 포함된 혼합된 데이터 유형(날것, 간격, 흐린 값 포함)에서의 결측치 문제를 다루기.
- 평균 대체나 리스트와이즈 삭제와 같은 전통적 보간 방법의 한계를 극복하여 편향을 유발할 수 있음을 방지하기.
- 각 데이터 유형에 적절한 거리 측도를 정의하여 k-NN 보간 프레임워크를 이질적인 데이터로 확장하기.
- 과적합 위험이 큰 관계로 인해 보간이 특히 어려운 작은 실세계 의사결정 데이터셋에서 방법을 평가하기.
- 결측치가 존재하는 상황에서도 데이터 신뢰성을 유지하는 데서 제안된 방법의 효과성과 강건성을 입증하기.
제안 방법
- 표준 유클리드 거리 측도를 사용하여 날것 수치의 거리 측도를 정의한다: $ d(a,b) = \sqrt{(a-b)^2} $.
- 간격 수치의 거리 측도를 $ d(\bar{a},\bar{b}) = \frac{1}{2}\sqrt{(a^L - b^L)^2 + (a^U - b^U)^2} $로 정의하며, 간격을 2차원 점으로 간주한다.
- 삼각 흐린 수치(TFNs)의 거리 측도를 소속 함수 간의 하우스도르프 거리(Hausdorff distance)를 사용하여 정의하여 흐린 값 간 비교를 가능하게 한다.
- 복합 거리 측도를 기반으로 k개의 가장 가까운 이웃을 식별하고, 그 이웃들의 결측치가 아닌 값들의 가중 평균을 계산하여 k-NN 보간을 적용한다.
- 역거리의 정규화된 가중치를 사용하여 보간된 값을 계산한다: $ \text{imputed} = \sum_{i=1}^{k} w_i \cdot x_i $, 여기서 $ w_i $는 정규화된 역거리이다.
- 다중 결측치를 처리하기 위해 반복적으로 방법을 적용하며, 이후 반복에서 보간된 값을 사용하여 정확도를 향상시킨다.
실험 결과
연구 질문
- RQ1k-NN 기반 보간 방법은 날것, 간격, 흐린 값이 동시에 포함된 데이터셋을 효과적으로 다룰 수 있는가?
- RQ2과적합 위험이 큰 작은 데이터셋에서 결측치가 존재하는 상황에서 이 방법의 보간 정확도는 어떠한가?
- RQ3다양한 이웃 수(k)와 다양한 데이터 유형에서 평균제곱오차(MSE)가 낮게 유지되는가?
- RQ4이질적인 데이터에 적용했을 때 표준 k-NN 보간 방법과 비교해 성능은 어떠한가?
- RQ5특히 소규모 의사결정 행렬에서 결측치 수가 증가함에 따라 이 방법은 강건한가?
주요 결과
- 소규모 의사결정 행렬에서 결측치 1~3개를 보간할 때 제안된 k-NN 보간 방법은 약 $ 1.2 \times 10^{-2} $의 평균제곱오차(MSE)를 달성하여 뛰어난 성능을 보였다.
- 더 큰 MCDM 데이터셋에서, k=1일 경우 MSE가 $ 1 \times 10^{-2} $로 가장 우수하고, k=2일 경우 $ 1.9 \times 10^{-2} $로 가장 열악하여 k에 민감함을 보였지만, 전반적으로 안정적인 성능을 유지했다.
- 다중 결측치가 포함된 5행 MCDM 행렬에서, k=4일 경우 MSE가 $ 5.1 \times 10^{-3} $로 가장 우수하고, k=1일 경우 $ 5.8 \times 10^{-3} $로 가장 열악하여 높은 정확도와 강건성을 보였다.
- 이 방법은 이웃 수(k)에 대해 민감도가 낮아 다양한 k 값에서도 일관된 성능을 유지하였으며, 실무에서의 주요 이점이다.
- 동질적인 데이터셋에서 보고된 결과와 동일한 주기수준의 오차를 유지하여, 이 방법이 이질적 데이터에 대해 효과적임을 확인했다.
- 한 사례 연구에서, 원래 값으로부터 거리가 0.0718인 흐린 값을 성공적으로 재구성하여 보간의 정밀도가 매우 높음을 나타냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.