Skip to main content
QUICK REVIEW

[논문 리뷰] Diversifying Support Vector Machines for Boosting using Kernel Perturbation: Applications to Class Imbalance and Small Disjuncts

Shounak Datta, Sayak Nag|arXiv (Cornell University)|2017. 12. 22.
Imbalanced Data Classification Techniques참고 문헌 25인용 수 4
한 줄 요약

이 논문은 RBF 커널을 적응적으로 수정하여 오분류된 점 주변의 분류 가능성을 향상시키는 커널 펌핑 기반 부스팅 프레임워크인 KPBoost-SVM을 제안한다. 이 방법은 클래스 불균형과 소규모 분리구역과 같은 국소적 데이터 비정상성에 초점을 맞춰 소수 클래스와 부분 개념에서의 성능을 향상시키며, 새로운 지표인 기하학적 소규모 분리구역 지수(GSDI)를 사용하여 다양한 데이터셋에서 최신 기술(SOTA)을 초월한다.

ABSTRACT

The diversification (generating slightly varying separating discriminators) of Support Vector Machines (SVMs) for boosting has proven to be a challenge due to the strong learning nature of SVMs. Based on the insight that perturbing the SVM kernel may help in diversifying SVMs, we propose two kernel perturbation based boosting schemes where the kernel is modified in each round so as to increase the resolution of the kernel-induced Reimannian metric in the vicinity of the datapoints misclassified in the previous round. We propose a method for identifying the disjuncts in a dataset, dispelling the dependence on rule-based learning methods for identifying the disjuncts. We also present a new performance measure called Geometric Small Disjunct Index (GSDI) to quantify the performance on small disjuncts for balanced as well as class imbalanced datasets. Experimental comparison with a variety of state-of-the-art algorithms is carried out using the best classifiers of each type selected by a new approach inspired by multi-criteria decision making. The proposed method is found to outperform the contending state-of-the-art methods on different datasets (ranging from mildly imbalanced to highly imbalanced and characterized by varying number of disjuncts) in terms of three different performance indices (including the proposed GSDI).

연구 동기 및 목표

  • SVM의 안정성과 앙상블 학습에서의 다양성 부족으로 인해 클래스 불균형 및 소규모 분리구역 데이터셋에서 성능이 떨어지는 문제를 해결한다.
  • 전통적인 재샘플링 및 커널 펌핑 방법이 어려운 분류 영역에만 집중하지 못하는 한계를 극복한다.
  • 오분류된 점 주변에서 커널에 의해 유도된 리만 메트릭의 해상도를 높이는 새로운 적응형 커널 펌핑 전략을 제안한다.
  • 소수로 표현된 부분 개념에 대한 성능을 정량적으로 평가하기 위해 기하학적 소규모 분리구역 지수(GSDI)라는 새로운 성능 지표를 도입한다.
  • 분류기 선택을 위한 다기준 의사결정 접근법을 사용하여 제안된 방법이 최신 기술 알고리즘을 일관되게 뛰어넘는다는 것을 입증한다.

제안 방법

  • 각 부스팅 라운드에서 RBF 커널의 커널 파라미터 σ를 수정하여 오분류된 인스턴스 주변의 국소 해상도를 높이기 위해 커널 펌핑을 적용한다.
  • 오분류된 점 주변의 쌍별 거리를 증폭시키는 동적 커널 업데이트 규칙을 사용하여 새로운 서포트 벡터와 다양한 결정 경계의 생성을 장려한다.
  • 커널에 의해 유도된 리만 메트릭을 바탕으로 한 기하학적 기준을 도입하여 더 높은 분류 해상도가 필요한 영역을 식별한다.
  • 규칙 기반 시스템에 의존하지 않는 분리구역 탐지 방법을 개발하여 데이터 내에서 자동으로 소규모로 표현되지 않은 부분 개념을 식별할 수 있도록 한다.
  • 각 라운드에서 오분류된 샘플에 더 높은 가중치를 할당하는 부스팅 프레임워크를 사용하여 펌핑된 SVM들을 앙상블한다.
  • 각 유형의 최고 성능을 보인 기반 분류기를 공정한 비교를 위해 확보하기 위해 다기준 의사결정 접근법을 사용하여 최적의 기반 분류기를 선택한다.

실험 결과

연구 질문

  • RQ1적응형 커널 펌핑이 부스팅 프레임워크 내에서 SVM의 다양성을 효과적으로 높여 클래스 불균형 및 소규모 분리구역 데이터셋에서의 성능을 향상시킬 수 있는가?
  • RQ2오분류된 점 주변에서 국소 해상도를 높이는 커널 펌핑은 전통적인 재샘플링 또는 전역 커널 수정 방법보다 부스팅 SVM에서 어떻게 더 나은가?
  • RQ3제안된 방법이 규칙 기반 학습에 의존하지 않고 소규모 분리구역을 얼마나 잘 탐지하고 개선할 수 있는가?
  • RQ4제안된 기하학적 소규모 분리구역 지수(GSDI)는 소수로 표현된 부분 개념에서의 성능를 캡처하는 데 기존 표준 지표보다 얼마나 더 우수한가?
  • RQ5제안된 KPBoost-SVM 프레임워크는 다양한 정도의 클래스 불균형과 분리구역 복잡도를 가진 데이터셋에서 최신 기술의 부스팅 및 앙상블 방법을 일관되게 뛰어넘는가?

주요 결과

  • 제안된 GSDI 지표 기준으로 KPBoost-SVM은 MMD 및 MHD 데이터셋에서 AdaBoost-MLP, RUSBoost, AKS-χ²*를 포함한 모든 비교 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • MMD1 데이터셋에서 KPBoost-SVM은 GSDI 1.0000을 기록하여 모든 방법 중에서 최고 성능을 보이며 소규모 분리구역에서 완벽한 성능을 나타냈다.
  • MHD9 데이터셋에서 KPBoost-SVM은 GSDI 0.7076을 기록하여 이어지는 최고 성능 방법인 AdaBoost-MLP*의 0.6762를 능가했으며, 극도로 불균형한 데이터에서의 강건성을 입증했다.
  • 모든 데이터셋에서 평균 GSDI 0.8426을 기록하여 두 번째로 좋은 방법인 AKS-χ²*의 0.7329보다 유의미하게 높았으며, 소규모 분리구역에서의 일관된 향상을 보였다.
  • 제안된 분리구역 탐지 방법은 규칙 기반 가정 없이도 부분 개념을 성공적으로 식별하여 표현되지 않은 패턴에 대한 대상 향상이 가능했다.
  • 다기준 분류기 선택 접근법을 통해 각 유형의 최고 성능 모델이 사용되었으며, 이는 KPBoost-SVM의 우월성이 다양한 실험 설정에서 견고함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.