Skip to main content
QUICK REVIEW

[논문 리뷰] A Scalable MIP-based Method for Learning Optimal Multivariate Decision Trees

Haoran Zhu, Pavankumar Murali|arXiv (Cornell University)|2020. 11. 06.
Machine Learning and Data Classification인용 수 17
한 줄 요약

이 논문은 1-노름 SVM를 기반으로 한 새로운 MIP 설정인 SVM1-ODT를 제안하여 최적의 다변량 결정 트리를 학습함으로써 기존 MIP 및 히우리스틱 방법 대비 검증 집합 정확도를 6–20% 향상시킨다. 이는 선형 회귀를 강화하기 위해 컷팅 플레인을 도입하고, 확장 가능한 LP 기반 데이터 선택 방법을 제안하여 최대 245,000개의 샘플을 갖는 데이터셋에서도 학습이 가능하게 하였다. 이는 기존 MIP 기반 접근 방식의 5,500개 샘플 한계를 초월한다.

ABSTRACT

Several recent publications report advances in training optimal decision trees (ODT) using mixed-integer programs (MIP), due to algorithmic advances in integer programming and a growing interest in addressing the inherent suboptimality of heuristic approaches such as CART. In this paper, we propose a novel MIP formulation, based on a 1-norm support vector machine model, to train a multivariate ODT for classification problems. We provide cutting plane techniques that tighten the linear relaxation of the MIP formulation, in order to improve run times to reach optimality. Using 36 data-sets from the University of California Irvine Machine Learning Repository, we demonstrate that our formulation outperforms its counterparts in the literature by an average of about 10% in terms of mean out-of-sample testing accuracy across the data-sets. We provide a scalable framework to train multivariate ODT on large data-sets by introducing a novel linear programming (LP) based data selection method to choose a subset of the data for training. Our method is able to routinely handle large data-sets with more than 7,000 sample points and outperform heuristics methods and other MIP based techniques. We present results on data-sets containing up to 245,000 samples. Existing MIP-based methods do not scale well on training data-sets beyond 5,500 samples.

연구 동기 및 목표

  • CART나 C4.5와 같은 히우리스틱 결정 트리 방법은 향후 분할을 고려하지 않고 한 번에 한 번씩 탐욕적인 분할 결정을 내려 최적성이 보장되지 않는 문제를 해결하기 위해.
  • 기존 MIP 기반 최적 결정 트리(ODT) 방법은 변수와 제약 조건이 급격히 증가하여 약 5,500개 샘플을 초월하는 데이터셋에서는 확장성에 한계를 가진다는 점을 해결하기 위해.
  • 1-노름 SVM를 기반으로 한 MIP 설정을 통해 최대 마진과 분류 정확도를 극대화하는 다변량 ODT를 학습하기 위한 강력하고 확장 가능한 프레임워크를 개발하기 위해.
  • 기존 MIP 기반 ODT 학습의 타당성 문제를 해결하기 위해, 전체 데이터셋의 핵심 정보를 유지하면서 문제 크기를 줄이는 새로운 LP 기반 데이터 선택 방법을 도입하여 대규모 실세계 데이터에 대한 MIP 기반 ODT 학습의 타당성을 향상시키기 위해.

제안 방법

  • 다변량 분할을 가능하게 하기 위해 분류 마진과 올바르게 분류된 인스턴스 수를 극대화하기 위해 1-노름 SVM 목표를 사용하는 새로운 MIP 설정인 SVM1-ODT를 제안한다.
  • MIP 설정의 선형 회귀를 강화하기 위해 컷팅 플레인 기법을 통합하여 정수성 간격을 줄이고 최적해에 수렴하는 속도를 높인다.
  • 재설정을 통해 big-M 제약 조건을 제거함으로써 수치적 안정성과 해의 품질을 향상시킨다.
  • MIP 학습 이전에 대표적인 데이터 포인트의 부분집합을 선택하는 LP 기반 데이터 선택 방법을 도입하여 정보를 유지하면서 문제 크기를 줄인다.
  • 선택된 부분집합을 사용하여 SVM1-ODT MIP 모델을 통해 ODT를 학습하고, 각 데이터셋에 맞게 정확도와 실행 시간의 균형을 맞추기 위해 파라미터를 조정한다.
  • 데이터 선택과 최적 트리 학습을 순차적으로 수행하는 이중 단계 학습 파이프라인을 적용하여 최대 245,000개 샘플 이상의 데이터셋에 대한 확장성을 확보한다.

실험 결과

연구 질문

  • RQ11-노름 SVM를 기반으로 한 MIP 설정이 기존 MIP 및 히우리스틱 방법보다 다변량 결정 트리의 검증 집합 분류 정확도에서 뛰어난 성능을 보일 수 있는가?
  • RQ2대규모 ODT 학습을 위한 MIP 회귀를 어떻게 강화하여 해의 수렴 속도와 최적성 간격을 향상시킬 수 있는가?
  • RQ3LP 기반 데이터 선택 방법이 대규모 데이터셋에서 학습 데이터 크기를 효과적으로 줄이면서도 모델 성능을 유지하는 데 효과적인가?
  • RQ4기존 MIP 기반 ODT 접근 방식의 5,500개 샘플 한계를 초월하는 데이터셋에 대해 제안된 방법이 얼마나 잘 확장되는가?
  • RQ5SVM1-ODT와 데이터 선택의 조합이 다양한 실세계 데이터셋에서 일관되게 정확도와 효율성을 향상시키는가?

주요 결과

  • SVM1-ODT 설정은 트리 깊이가 2인 20개의 UCI 데이터셋에서 최신 MIP 및 히우리스틱 방법 대비 평균 6–10% 향상된 검증 집합 정확도를 달성한다.
  • 트리 깊이가 3일 경우, 평균 17–20% 향상된 정확도를 보이며 더 깊은 트리에서의 강력한 성능을 입증한다.
  • LP 기반 데이터 선택 방법은 원본 데이터셋의 1–12%로 학습 샘플 수를 줄이면서도 높은 정확도를 유지하여 최대 245,000개 샘플의 데이터셋에서도 학습이 가능하게 한다.
  • Avila(104,300개 샘플)와 skin-segmentation(245,057개 샘플)과 같은 대규모 데이터셋에서 깊이 3일 때 각각 86.3%와 94.9%의 검증 정확도를 기록하며 CART 및 OCT-H를 능가한다.
  • 이 방법은 정확도와 확장성 측면에서 기준 MIP 모델과 히우리스틱 기반 기준 모델을 일관되게 능가하며, 대규모 데이터셋에서도 학습 시간이 4시간 이내로 유지된다.
  • 컷팅 플레인의 사용과 big-M 제약 조건의 제거로 인해 MIP 회귀의 강도가 크게 향상되어 해의 수렴 시간이 단축되고 최적성 간격이 개선된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.