Skip to main content
QUICK REVIEW

[논문 리뷰] Performance comparison of State-of-the-art Missing Value Imputation Algorithms on Some Bench mark Datasets

M. Naresh Kumar|arXiv (Cornell University)|2013. 07. 22.
Machine Learning and Data Classification참고 문헌 22인용 수 3
한 줄 요약

이 논문은 데이터셋 내 결측치 추정을 향상시키기 위해 새로운 색인 측정법과 거리 계산을 사용하는 RNI-II 보간 알고리즘을 제안한다. UCI 및 KEEL 기준 데이터셋에서 평가한 결과, RNI-II는 KNNI, WKNNI, KMI, FKMI, SVMI보다 분류 정확도 향상에서 유의미하게 뛰어나며(p < 0.05), C4.5 및 GA-C4.5 결정트리 분류기 성능을 개선한다.

ABSTRACT

Decision making from data involves identifying a set of attributes that contribute to effective decision making through computational intelligence. The presence of missing values greatly influences the selection of right set of attributes and this renders degradation in classification accuracies of the classifiers. As missing values are quite common in data collection phase during field experiments or clinical trails appropriate handling would improve the classifier performance. In this paper we present a review of recently developed missing value imputation algorithms and compare their performance on some bench mark datasets.

연구 동기 및 목표

  • 실제 세계 기준 데이터셋에서 현대적 결측치 보간 알고리즘의 성능을 평가하기 위해.
  • 임상 및 시간적 데이터베이스에서 결측치로 인한 분류기 정확도 저하 문제를 해결하기 위해.
  • 분류 성능 향상을 위해 RNI-II 알고리즘을 제안하고 검증하기 위해.
  • 표준 UCI 및 KEEL 데이터셋을 사용해 RNI-II를 KNNI, WKNNI, KMI, FKMI 및 SVMI와 비교하기 위해.
  • 윌코크슨 부호 순위 검정을 통해 RNI-II의 성능 향상이 통계적으로 유의미한지 확인하기 위해.

제안 방법

  • RNI-II는 데이터 레코드 유사도를 평가하기 위해 새로운 색인 측정법을 계산하여, 완전하지 않은 레코드 간의 더 정확한 거리 추정을 가능하게 한다.
  • 이 알고리즘은 이 색인 측정법을 사용해 데이터 포인트 간의 유사도를 계산하고, 보간 과정에서 기존의 유클리드 거리 대신 사용한다.
  • 보간은 새로운 거리 기반 측정법에 기반해 가장 유사한 레코드를 식별하고, 이웃의 값을 할당함으로써 수행된다.
  • 수치형 속성의 경우, 유사한 이웃의 평균을 사용하고, 명목형 속성의 경우 모드를 선택한다.
  • 이 방법은 분류 정확도에 대한 보간 영향을 평가하기 위해 결정트리 분류기(C4.5 및 GA-C4.5)와 통합된다.
  • 성능 차이의 통계적 유의성은 유의수준 α = 0.05에서 윌코크슨 부호 순위 검정을 통해 검증된다.

실험 결과

연구 질문

  • RQ1RNI-II 보간 알고리즘이 기준 데이터셋에서 KNNI, WKNNI, KMI, FKMI 및 SVMI와 비교해 성능 면에서 어떻게 다른가?
  • RQ2RNI-II는 결측치를 처리할 때 C4.5 및 GA-C4.5 분류기의 분류 정확도를 유의미하게 향상시키는가?
  • RQ3RNI-II의 성능 향상은 다른 보간 방법과 비교해 통계적으로 유의미한가?
  • RQ4RNI-II에 내장된 새로운 색인 측정법이 전통적인 거리 기반 방법에 비해 보간 정확도를 얼마나 향상시키는가?
  • RQ5다양한 실제 세계 데이터셋에서 다양한 보간 전략은 분류기 성능에 어떤 영향을 미치는가?

주요 결과

  • GA-C4.5 분류기를 사용한 AUS 데이터셋에서 RNI-II는 평균 테스트 정확도 85.65%를 기록했으며, FKMI(81.45%) 및 KMI(81.16%)보다 유의미하게 뛰어났다.
  • IRM 데이터셋에서 RNI-II는 C4.5 정확도를 FKMI, KNNI 및 WKNNI 대비 약 8% 향상시켰다.
  • 윌코크슨 부호 순위 검정 결과, RNI-II를 KMI, FKMI, KNNI 및 WKNNI와 비교했을 때 p-값이 0.02 이하로 나타나 통계적 유의성이 확인되었다.
  • GA-C4.5에 대해 RNI-II는 모든 비교 대상 방법 대비 가장 높은 양의 순위 합(28)을 기록했으며, p-값 ≤ 0.05였다.
  • RNI-II는 SVMI와 비교했을 때 통계적 유의성이 없었지만(p = 0.37), 대부분의 데이터셋에서 더 높은 정확도를 기록했다.
  • 시각적 분석(그림 2–6)은 RNI-II가 모든 데이터셋에서 일관되게 높은 정확도 향상을 제공했음을 확인했으며, 기준선을 초월하는 막대는 일관된 성능 향상을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.