Skip to main content
QUICK REVIEW

[논문 리뷰] Pooling homogeneous ensembles to build heterogeneous ones

Maryam Sabzevari, Gonzalo Martínez-Muñoz|arXiv (Cornell University)|2018. 02. 21.
Neural Networks and Applications인용 수 4
한 줄 요약

이 논문은 서로 다른 유형의 사전 훈련된 동종 앙상블(예: SVM, MLP, 랜덤 포레스트)을 연속적인 심플렉스 기반 조합 전략을 사용해 풀링함으로써 이종 앙상블를 구축하는 새로운 방법을 제안한다. 부트스트래핑 샘플링을 통해 각 동종 앙상블의 분류기 비율을 검증 데이터(Out-of-Bag 또는 교차 검증)를 통해 최적화함으로써, 다양한 데이터셋에서 일관되게 뛰어난 성능을 달성하며, 개별 동종 앙상블 및 기존의 이종 조합 방법보다 정확도와 내구성 면에서 뛰어나다.

ABSTRACT

In ensemble methods, the outputs of a collection of diverse classifiers are combined in the expectation that the global prediction be more accurate than the individual ones. Heterogeneous ensembles consist of predictors of different types, which are likely to have different biases. If these biases are complementary, the combination of their decisions is beneficial. In this work, a family of heterogeneous ensembles is built by pooling classifiers from M homogeneous ensembles of different types of size T. Depending on the fraction of base classifiers of each type, a particular heterogeneous combination in this family is represented by a point in a regular simplex in M dimensions. The M vertices of this simplex represent the different homogeneous ensembles. A displacement away from one of these vertices effects a smooth transformation of the corresponding homogeneous ensemble into a heterogeneous one. The optimal composition of such heterogeneous ensemble can be determined using cross-validation or, if bootstrap samples are used to build the individual classifiers, out-of-bag data. An empirical analysis of such combinations of bootstraped ensembles composed of neural networks, SVMs, and random trees (i.e. from a standard random forest) illustrates the gains that can be achieved by this heterogeneous ensemble creation method.

연구 동기 및 목표

  • 기존의 동종 앙상블에서 유래한 다양한 기반 분류기들을 활용하여 효과적인 이종 앙상블를 구성하는 데 도전하는 것.
  • 분류기 유형의 수 M에 따라 M차원 정규 심플렉스를 사용하는 연속적이고 파rameterized된 이종 앙상블 조합 프레임워크를 개발하는 것.
  • 최적의 이종 앙상블 구성—즉, 각 분류기 유형의 이상적인 비율—을 Out-of-Bag 데이터 또는 교차 검증을 통해 결정하는 것.
  • 이러한 조합 전략이 일관되게 개별 동종 앙상블 및 기존의 이종 앙상블 방법보다 뛰어난 성능을 보임을 경험적으로 검증하는 것.
  • 다양한 벤치마크 데이터셋에서 예측 정확도 향상이 통계적으로 유의미한지 입증하는 것.

제안 방법

  • 다양한 분류기 유형(SVM, MLP, 랜덤 포레스트 등)을 사용해 M개의 동종 앙상블를 구성하며, 다양성을 확보하기 위해 부트스트래핑 샘플링을 통해 각각 훈련한다.
  • 이들 M개의 동종 앙상블에서 분류기를 조합하여 이종 앙상블를 형성하며, 구성은 M차원 정규 심플렉스 내의 한 점으로 정의된다.
  • 심플렉스의 각 꼭짓점은 하나의 동종 앙상블에 대응하며, 심플렉스 내의 위치는 최종 앙상블에 포함된 각 유형의 분류기 비율을 결정한다.
  • 부트스트래핑 샘플링을 사용할 경우, 최적의 구성은 Out-of-Bag(OOB) 오차율을 사용해 추정하며, 적용 가능한 경우 교차 검증을 활용한다.
  • 최종 이종 앙상블는 OOB 또는 교차 검증을 통해 확보된 최적의 구성에서 유도된 가중치를 사용해 예측을 가중 평균한다.
  • 이 방법은 동종 앙상블 간의 부드러운 보간을 가능하게 하며, 이종 구성에 대한 체계적인 탐색을 허용한다.

실험 결과

연구 질문

  • RQ1기존의 서로 다른 유형의 동종 앙상블를 풀링함으로써 연속적인 이종 앙상블의 가족을 구성할 수 있는가?
  • RQ2이종 앙상블의 최적 조합—즉, 각 유형의 분류기 비율—은 다양한 학습 문제 간에 유의미하게 다를 수 있는가?
  • RQ3Out-of-Bag 오차 추정은 이종 앙상블의 최적 조합을 결정하는 데 신뢰할 수 있고 효율적인 방법이 될 수 있는가?
  • RQ4제안된 방법은 다양한 데이터셋에서 개별 동종 앙상블(예: 랜덤 포레스트, SVM 앙상블, MLP 앙상블)보다 항상 더 정확한가?
  • RQ5기존의 앙상블 방법과 비교해 제안된 이종 앙상블의 성능 향상은 통계적으로 유의미한가?

주요 결과

  • 제안된 방법은 17개의 모든 벤치마크 데이터셋에서 최고 또는 2위 성능을 기록하며, 개별 동종 앙상블 및 기존의 이종 조합 방법을 모두 능가했다.
  • 평균적으로, 이 방법은 랜덤 포레스트(RF), MLP 앙상블(E-MLP), SVM 앙상블(E-SVM)보다 낮은 테스트 오차를 기록했으며, RF 및 E-MLP보다 통계적으로 유의미한 우위를 보였다(p < 0.05).
  • 이종 앙상블의 최적 조합은 문제에 따라 크게 달라졌으며, 데이터셋 간에 분류기 비율이 크게 변했다—예를 들어, Bupa 데이터셋에서는 랜덤 트리 비율이 63.0%였고, Colic 데이터셋에서는 91.9%였다.
  • Demšar 검정에서 이 방법은 평균 순위 1.55를 기록했으며, E-MLP(평균 순위 1.50)를 능가했고, E-SVM(평균 순위 1.41)에 이어 두 번째로 높은 순위를 기록했지만, E-SVM과의 차이는 통계적으로 유의미하지 않았다.
  • Ringnorm 데이터셋에서는 테스트 오차가 1.6% ± 0.4%를 기록했으며, E-MLP(16.4% ± 1.5%) 및 E-SVM(1.7% ± 0.5%)보다 유의미하게 낮아, 복잡한 비선형 문제에서 강력한 성능을 보였다.
  • 이 방법은 모든 데이터셋에서 오차율을 일관되게 감소시켰으며, OOB 검증을 통해 최고 성능을 낸 구성이 선택됨으로써 최적화 전략의 효과성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.