[논문 리뷰] Using Association Rules for Better Treatment of Missing Values
이 논문은 데이터 마이닝에서 결측치 처리를 향상시키기 위해 연관 규칙 마이닝과 k-최근접 이웃(k-NN) 접근 방식을 조합한 새로운 하이브리드 결측치 보정 기법(HMiT)을 제안한다. 기존의 k-NN 기반 보정 방법에 비해 정확도를 높이고 처리 시간을 단축시키며, 실제 데이터셋에서 뛰어난 성능을 보여준다.
The quality of training data for knowledge discovery in databases (KDD) and data mining depends upon many factors, but handling missing values is considered to be a crucial factor in overall data quality. Today real world datasets contains missing values due to human, operational error, hardware malfunctioning and many other factors. The quality of knowledge extracted, learning and decision problems depend directly upon the quality of training data. By considering the importance of handling missing values in KDD and data mining tasks, in this paper we propose a novel Hybrid Missing values Imputation Technique (HMiT) using association rules mining and hybrid combination of k-nearest neighbor approach. To check the effectiveness of our HMiT missing values imputation technique, we also perform detail experimental results on real world datasets. Our results suggest that the HMiT technique is not only better in term of accuracy but it also take less processing time as compared to current best missing values imputation technique based on k-nearest neighbor approach, which shows the effectiveness of our missing values imputation technique.
연구 동기 및 목표
- 실제 데이터셋에서 결측치 문제로 인한 데이터 품질 저하 및 지식 발굴에 미치는 영향을 해결하기 위해.
- 데이터 마이닝 및 데이터베이스에서의 지식 발굴(KDD)에서 결측치 보정의 정확도와 효율성을 향상시키기 위해.
- 연관 규칙 마이닝과 k-NN을 융합한 하이브리드 접근 방식을 개발하여 보다 효과적인 보정을 실현하기 위해.
- 실제 데이터셋을 대상으로 제안된 HMiT 기법을 기존 최첨단 보정 방법과 비교 평가하기 위해.
제안 방법
- HMiT 기법은 결측치 예측에 도움이 되는 속성 간의 관계를 식별하기 위해 연관 규칙 마이닝을 활용한다.
- 이 연관 규칙를 k-최근접 이웃(k-NN) 접근 방식과 통합하여 유사한 데이터 인스턴스 기반으로 보정 결정을 정밀화한다.
- 먼저 완전한 데이터 서브셋에서 빈번한 아이템세트를 탐지하고 규칙을 생성하기 위해 연관 규칙 마이닝을 적용한다.
- 결측치는 유사한 이웃에 대한 k-NN 기반 평균과 규칙 기반 예측을 결합하여 보정한다.
- 규칙 기반 및 k-NN 기반 보정의 동적 가중치를 설정하여 정확도와 성능을 최적화하는 하이브리드 모델을 구성한다.
- 실제 데이터셋을 대상으로 보정 정확도와 계산 효율성을 평가하기 위해 이 방법을 평가한다.
실험 결과
연구 질문
- RQ1연관 규칙 마이닝을 k-NN와 효과적으로 융합하여 결측치 보정 성능을 향상시킬 수 있는가?
- RQ2제안된 HMiT 기법이 기존의 k-NN 기반 보정 방법에 비해 정확도와 처리 시간 측면에서 뛰어나게 성능을 발휘하는가?
- RQ3연관 규칙가 데이터의 잠재적 의존성을 포착함으로써 보정된 값의 신뢰성을 향상시킬 수 있는가?
- RQ4이러한 하이브리드 접근 방식이 실제 데이터셋의 데이터 품질에 미치는 영향은 어떠한가?
주요 결과
- HMiT 기법은 실제 데이터셋에서 기존의 k-NN 기반 방법에 비해 더 높은 보정 정확도를 달성한다.
- 제안된 방법은 정확도를 유지하거나 향상시키면서도 처리 시간을 크게 단축시킨다.
- 연관 규칙 마이닝은 속성 간 의존성을 포착함으로써 더 맥락 인식형 보정을 가능하게 한다.
- 연관 규칙와 k-NN의 하이브리드 통합은 더 견고하고 신뢰할 수 있는 결측치 추정을 이끈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.