Skip to main content
QUICK REVIEW

[논문 리뷰] Deep differentiable forest with sparse attention for the tabular data

Yingshi Chen|arXiv (Cornell University)|2020. 02. 29.
Advanced Neural Network Applications참고 문헌 19인용 수 4
한 줄 요약

이 논문은 표본 데이터에 적응하는 주의 힘을 통해 희소 주의를 갖는 딥 유연성 숲을 제안한다. 이는 의사결정 트리의 해석 가능성과 신경망의 최적화 능력을 결합한다. 데이터 기반 초기화를 통해 주의 가중치의 희소성을 강제함으로써, 모델은 XGBoost보다 큰 표본 데이터셋에서 더 높은 정확도를 달성하면서도 기울기 기반 학습을 위한 완전한 유연성 유지한다.

ABSTRACT

We present a general architecture of deep differentiable forest and its sparse attention mechanism. The differentiable forest has the advantages of both trees and neural networks. Its structure is a simple binary tree, easy to use and understand. It has full differentiability and all variables are learnable parameters. We would train it by the gradient-based optimization method, which shows great power in the training of deep CNN. We find and analyze the attention mechanism in the differentiable forest. That is, each decision depends on only a few important features, and others are irrelevant. The attention is always sparse. Based on this observation, we improve its sparsity by data-aware initialization. We use the attribute importance to initialize the attention weight. Then the learned weight is much sparse than that from random initialization. Our experiment on some large tabular dataset shows differentiable forest has higher accuracy than GBDT, which is the state of art algorithm for tabular datasets. The source codes are available at https://github.com/closest-git/QuantumForest

연구 동기 및 목표

  • 의사결정 트리의 해석 가능성과 신경망 최적화 능력을 결합한 딥, 유연한 결합 숲 아키텍처를 개발하는 것.
  • 각 결정에서 영향을 미치는 특성 수가 적은 주의 메커니즘을 식별하고 활용하는 것.
  • 특성 중요도를 사용해 주의 가중치를 초기화함으로써 모델의 희소성을 향상시켜 무작위 초기화에 대한 의존도를 줄이는 것.
  • 큰 표본 데이터셋에서 최첨단 기울기 부스팅 결합 트리(GBDT)를 능가하는 것.
  • 모든 구성 요소가 유연한 구조를 통해 기울기 하강법을 사용한 엔드 투 엔드 학습을 가능하게 하는 것.

제안 방법

  • 학습 가능한 가중치로 파arameter화된 유연한 결정 함수를 사용하는 단순한 이진 트리 구조를 사용한다.
  • 각 트리의 분할은 가중치가 부여된 특성에 대해 적용된 유연한 시그모이드 함수를 통해 계산되며, 이는 역전파를 가능하게 한다.
  • 주의는 각 노드에서 특성의 희소 선택으로 모델링되며, 결정에 크게 기여하는 특성은 소수에 불과하다.
  • 사전에 학습된 트리에서 얻은 특성 중요도 점수를 사용해 주의 가중치를 초기화함으로써 희소성을 강화하여 관련 없는 특성의 조기 제거를 촉진한다.
  • 표준 역전파를 사용해 기울기 기반 최적화를 통해 전체 아키텍처를 학습한다.
  • 모든 파rameter에서 완전한 유연성을 확보함으로써 표본 데이터에 대한 엔드 투 엔드 학습을 지원한다.

실험 결과

연구 질문

  • RQ1유연한 결합 숲 아키텍처가 표본 데이터에서 전통적인 기울기 부스팅 트리보다 더 높은 정확도를 달성할 수 있는가?
  • RQ2유연한 결합 숲에서 주의가 자연스럽게 희소성을 보이며, 각 결정에 영향을 미치는 특성이 소수에 불과한가?
  • RQ3데이터 기반 초기화된 주의 가중치가 무작위 초기화보다 모델의 희소성과 성능을 향상시킬 수 있는가?
  • RQ4유연성이 트리 기반 모델의 효과적인 엔드 투 엔드 학습을 얼마나 잘 가능하게 하는가?
  • RQ5제안된 모델은 XGBoost와 같은 최첨단 표본 학습 방법과 비교해 어떻게 성능을 냈는가?

주요 결과

  • 딥 유연성 숲은 큰 표본 데이터셋에서 XGBoost를 뛰어넘는 더 높은 정확도를 달성하여 열등한 성능을 입증한다.
  • 유연한 결합 숲의 주의 메커니즘은 본질적으로 희소하며, 각 결정에 기여하는 특성의 소수의 부분집합만 영향을 미친다.
  • 데이터 기반 초기화된 주의 가중치는 무작위 초기화보다 훨씬 더 희소한 주의 패턴을 만들어낸다.
  • 모델의 완전한 유연성 덕분에 기울기 기반 최적화를 통해 효과적인 학습이 가능하며, 딥 신경망과 유사하다.
  • 트리 구조를 통해 해석 가능성을 유지하면서도 GBDT와 동등하거나 그 이상의 성능을 달성한다.
  • 소스 코드는 공개되어 있어 재현성과 향후 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.