Skip to main content
QUICK REVIEW

[논문 리뷰] Decision trees as partitioning machines to characterize their generalization properties

Jean-Samuel Leboeuf, Frédéric LeBlanc|arXiv (Cornell University)|2020. 10. 14.
Machine Learning and Data Classification참고 문헌 31인용 수 4
한 줄 요약

이 논문은 실수형 특징을 가진 决定 트리의 일반화 성질을 분석하기 위한 새로운 프레임워크로 분할 함수를 제안한다. 결정 스텁의 정확한 VC 차원을 2ℓ ≥ C(d, ⌊d/2⌋)를 만족하는 가장 큰 정수 d로 유도하며, 내부 노드 수가 N인 이진 트리의 VC 차원에 대한 상한을 O(N log(Nℓ))으로 설정하여, 교차 검증이 필요 없이 CART를 능가하는 새로운 가지치기 알고리즘을 가능하게 한다.

ABSTRACT

Decision trees are popular machine learning models that are simple to build and easy to interpret. Even though algorithms to learn decision trees date back to almost 50 years, key properties affecting their generalization error are still weakly bounded. Hence, we revisit binary decision trees on real-valued features from the perspective of partitions of the data. We introduce the notion of partitioning function, and we relate it to the growth function and to the VC dimension. Using this new concept, we are able to find the exact VC dimension of decision stumps, which is given by the largest integer $d$ such that $2\ell \ge \binom{d}{\left\lfloor\frac{d}{2} ight floor}$, where $\ell$ is the number of real-valued features. We provide a recursive expression to bound the partitioning functions, resulting in a upper bound on the growth function of any decision tree structure. This allows us to show that the VC dimension of a binary tree structure with $N$ internal nodes is of order $N \log(N\ell)$. Finally, we elaborate a pruning algorithm based on these results that performs better than the CART algorithm on a number of datasets, with the advantage that no cross-validation is required.

연구 동기 및 목표

  • 실수형 특징을 가진 이진 결정 트리의 VC 차원과 성장 함수에 대한 날카로운 상한이 부족한 문제를 해결하기 위해.
  • 새로운 개념인 분할 함수를 사용하여 결정 트리의 일반화 오차를 이론적으로 특성화하기 위해.
  • 실수형 특징을 가진 결정 스텁의 정확한 VC 차원을 유도하여 이전에 알려지지 않은 상한을 해결하기 위해.
  • 분할 함수 프레임워크를 일반 이진 트리 구조로 확장하고, 그 VC 차원에 대한 渐近 상한을 도출하기 위해.
  • 교차 검증이 필요 없이 CART를 능가하는 성능을 보이는 가지치기 알고리즘을 개발하기 위해.

제안 방법

  • 실수형 특징에 대해 결정 트리 구조가 유도하는 서로 다른 데이터 파artition 수를 측정하는 분할 함수를 도입한다.
  • 분할 함수를 성장 함수와 VC 차원과 연결하여 일반화 오차의 이론적 분석을 가능하게 한다.
  • 그래프 이론적 방법을 사용하여 결정 스텁의 정확한 VC 차원을 2ℓ ≥ C(d, ⌊d/2⌋)를 만족하는 가장 큰 d로 유도하며, 여기서 ℓ는 특징 수이다.
  • 일반 이진 트리 구조에 대한 분할 함수에 대한 재귀적 상한을 개발하여, 내부 노드 수가 N인 트리의 VC 차원에 대해 O(N log(Nℓ))의 상한을 도출한다.
  • 유도된 VC 차원 상한을 기반으로 한 가지치기 알고리즘을 제안하며, 교차 검증 대신 이론적 위험 상한을 사용한다.
  • 표본 압축과 VC 기반 일반화 상한을 활용하여 트리의 가지치기를 유도하면서도 높은 테스트 정확도를 유지한다.

실험 결과

연구 질문

  • RQ1ℓ개의 실수형 특징으로 구성된 결정 스텁의 정확한 VC 차원은 무엇인가?
  • RQ2분할 함수는 일반 이진 결정 트리 구조의 성장 함수와 VC 차원을 어떻게 제한하는가?
  • RQ3내부 노드 수가 N개이고 실수형 특징 수가 ℓ개인 이진 결정 트리의 VC 차원은 渐近적으로 어떻게 행동하는가?
  • RQ4VC 차원에 대한 이론적 상한을 활용하여 교차 검증이 필요 없이 CART를 능가하는 가지치기 알고리즘을 설계할 수 있는가?
  • RQ5다양한 데이터셋에서 제안된 가지치기 방법은 성능과 효율성 측면에서 CART와 어떻게 비교되는가?

주요 결과

  • ℓ개의 실수형 특징을 가진 결정 스텁의 정확한 VC 차원은 2ℓ ≥ C(d, ⌊d/2⌋)를 만족하는 가장 큰 정수 d이며, 이는 이전에 알려지지 않은 상한을 해결한다.
  • 내부 노드 수가 N이고 실수형 특징 수가 ℓ개인 이진 결정 트리의 VC 차원은 O(N log(Nℓ))이며, 이는 날카로운 渐近 상한을 제공한다.
  • 이론적 VC 상한을 기반으로 한 제안된 가지치기 알고리즘은 테스트한 11개 데이터셋 중 10개에서 CART보다 높은 테스트 정확도를 달성한다. 이는 Ionosphere, Iris, Parkinson, Spambase 등 포함.
  • 새로운 가지치기 방법은 잎 노드 수와 트리 높이를 줄이면서도 테스트 정확도를 유지하거나 향상시키며, 더 큰 데이터셋에서는 CART보다 훨씬 빠른 런타임을 보인다.
  • CART가 교차 검증에서 고분산으로 인해 과적합되는 Yeast 및 Planning Relax 등의 데이터셋에서, 제안된 방법은 CART보다 더 우수한 일반화 성능을 보인다.
  • 제안된 방법이 계산한 상한(예: Yeast에서 22.3 ± 0.3)은 일반화 성능과 상관관계가 있으며, 교차 검증 없이도 가지치기 유도에 사용된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.