Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Feature Scaling for K-Nearest Neighbor Algorithm

Chandrasekaran Anirudh Bhardwaj, Megha Mishra|arXiv (Cornell University)|2018. 11. 13.
Data Mining Algorithms and Applications참고 문헌 18인용 수 4
한 줄 요약

이 논문은 K-Nearest Neighbor (K-NN) 알고리즘을 위한 동적 특성 스케일링 방법을 제안하며, 다수의 결정트리에서의 out-of-bag 오차 추정치를 기반으로 각 특성에 대해 개별적인 특성 가중치를 부여함으로써, 균일한 스케일링을 초월하여 특성 중요도를 적응적으로 반영함으로써 예측 정확도를 향상시킨다. 이 방법은 앙상블 모델 성능을 통해 특성별 가중치를 학습함으로써 표준 정규화 기법보다 뛰어난 성능을 보인다.

ABSTRACT

Nearest Neighbors Algorithm is a Lazy Learning Algorithm, in which the algorithm tries to approximate the predictions with the help of similar existing vectors in the training dataset. The predictions made by the K-Nearest Neighbors algorithm is based on averaging the target values of the spatial neighbors. The selection process for neighbors in the Hermitian space is done with the help of distance metrics such as Euclidean distance, Minkowski distance, Mahalanobis distance etc. A majority of the metrics such as Euclidean distance are scale variant, meaning that the results could vary for different range of values used for the features. Standard techniques used for the normalization of scaling factors are feature scaling method such as Z-score normalization technique, Min-Max scaling etc. Scaling methods uniformly assign equal weights to all the features, which might result in a non-ideal situation. This paper proposes a novel method to assign weights to individual feature with the help of out of bag errors obtained from constructing multiple decision tree models.

연구 동기 및 목표

  • 모든 특성이 동일하게 취급되는 K-NN에서의 균일한 특성 스케일링의 한계를 해결하기 위해, 예측 중요도가 상이한 특성들에 대해 균일한 스케일링을 초월하여 특성 중요도를 반영하는 방법을 개발한다.
  • 목표 변수에 대한 개별 특성의 관련성을 반영하는 데이터 기반의 특성 가중치 할당 방법을 개발한다.
  • 정적 정규화를 대체하여 적응적이고 모델 기반의 특성 스케일링을 통해 K-NN 성능을 향상시킨다.
  • Z-score나 Min-Max 스케일링과 같은 고정된 정규화 기법에 의존하지 않고 특성 스케일 변동에 대한 민감도를 감소시킨다.

제안 방법

  • 학습 데이터의 부트스트랩 샘플에 기반해 다수의 결정트리를 훈련시어 각 특성에 대한 out-of-bag (OOB) 오차율을 계산한다.
  • 특성 중요도는 앙상블 내의 각 트리에서 해당 특성이 기여한 OOB 오차 감소량을 기반으로 도출된다.
  • OOB 오차 기반 중요도 점수를 활용해 K-NN에서 거리 계산 전에 특성에 동적 가중치를 할당한다.
  • K-NN의 거리 계산은 이러한 학습된 특성 가중치를 통합하여, 특성의 예측 능력에 따라 효과적으로 스케일링되도록 수정된다.
  • 최종 K-NN 예측은 가중 거리 계량법을 사용하며, 중요도가 높은 특성은 이웃 선택에 더 큰 기여를 한다.
  • 모델 성능에서 특성별 스케일링을 학습함으로써 전역 정규화에 의존하지 않는다.

실험 결과

연구 질문

  • RQ1앙상블 모델에서 유도된 특성 가중치가 균일한 스케일링 대비 K-NN 성능 향상에 기여하는가?
  • RQ2OOB 오차 기반 동적 특성 가중치가 K-NN 예측 정확도에 어떤 영향을 미치는가?
  • RQ3제안된 방법은 실세계 데이터셋에서 특성 스케일 변동에 대해 민감도를 감소시키는가?
  • RQ4라벨이 부여된 검증 세트가 필요 없이 OOB 오차 추정치가 K-NN에 대한 특성 중요도를 신뢰성 있게 안내할 수 있는가?

주요 결과

  • 제안된 동적 특성 스케일링 방법은 Z-score나 Min-Max 스케일링과 같은 표준 정규화 기법보다 K-NN 예측 정확도를 크게 향상시킨다.
  • out-of-bag 오차에서 도출된 특성 가중치는 예측 관련성을 효과적으로 포착하여 거리 계산에서 더 나은 이웃 선택을 이끈다.
  • 모델 성능에 기여도가 낮은 특성들을 낮은 가중치로 할당함으로써 불필요하거나 노이즈가 많은 특성의 영향을 감소시킨다.
  • 특성 스케일 변동에 대한 저항력이 뛰어나며, 전역적인 균일한 스케일링이 아니라 특성별로 적응적으로 가중치를 조정하기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.