Skip to main content
QUICK REVIEW

[논문 리뷰] Extracting more from boosted decision trees: A high energy physics case study

Vidhi Lalchand|arXiv (Cornell University)|2020. 01. 16.
Particle physics theoretical and experimental studies참고 문헌 12인용 수 5
한 줄 요약

이 논문은 고에너지물리학에서 입자 식별을 위한 강화된 결정트리(BDT)의 성능을 향상시키기 위해 부스팅과 배깅을 조합한 새로운 앙상블 방법인 Boosted Extremely Random Trees(BXT)를 제안한다. 트리 분할 시 무작위성과 부트스트랩 샘플링을 도입함으로써 과적합을 줄이고 일반화 능력을 향상시켰으며, ATLAS 힉스 → 타우-타우 데이터셋에서 AMS 점수 3.79361σ를 기록하여 우승한 DNN 앙상블 점수 3.8058σ에 매우 근접한 성능을 달성했으며, 동시에 DNN보다 훨씬 더 계산 효율적이다.

ABSTRACT

Particle identification is one of the core tasks in the data analysis pipeline at the Large Hadron Collider (LHC). Statistically, this entails the identification of rare signal events buried in immense backgrounds that mimic the properties of the former. In machine learning parlance, particle identification represents a classification problem characterized by overlapping and imbalanced classes. Boosted decision trees (BDTs) have had tremendous success in the particle identification domain but more recently have been overshadowed by deep learning (DNNs) approaches. This work proposes an algorithm to extract more out of standard boosted decision trees by targeting their main weakness, susceptibility to overfitting. This novel construction harnesses the meta-learning techniques of boosting and bagging simultaneously and performs remarkably well on the ATLAS Higgs (H) to tau-tau data set (ATLAS et al., 2014) which was the subject of the 2014 Higgs ML Challenge (Adam-Bourdarios et al., 2015). While the decay of Higgs to a pair of tau leptons was established in 2018 (CMS collaboration et al., 2017) at the 4.9$σ$ significance based on the 2016 data taking period, the 2014 public data set continues to serve as a benchmark data set to test the performance of supervised classification schemes. We show that the score achieved by the proposed algorithm is very close to the published winning score which leverages an ensemble of deep neural networks (DNNs). Although this paper focuses on a single application, it is expected that this simple and robust technique will find wider applications in high energy physics.

연구 동기 및 목표

  • 고에너지물리학(HEP) 분류에서 주요 약점인 표준 부스팅된 결정트리(BDT)의 과적합 문제를 해결하기 위해.
  • HEP 데이터셋에서 흔히 발생하는 겹치는 클래스와 불균형 클래스를 포함한 입자 식별 작업에서의 성능 향상을 위해.
  • 부스팅(편향 감소)과 배깅(분산 감소)의 장점을 하나의 프레임워크 안에서 통합하는 방법을 개발하기 위해.
  • 심층신경망(DNN)에 비해 더 간단하고 해석 가능한 모델인 BXT가 벤치마크 HEP 데이터셋에서 경쟁력 있는 성능을 낼 수 있음을 입증하기 위해.

제안 방법

  • 이 방법은 부트스트랩 샘플링을 통해 각 부스팅 단계에서 배깅을 적용하는 BDT의 변종인 Boosted Extremely Random Trees(BXT)를 도입한다.
  • 각 부스팅 반복 단계에서 기저 학습기(극도로 무작위로 분할된 트리)는 데이터의 부트스트랩 샘플에서 학습되며, 특성 값 범위 내에서 무작위로 분할 기준을 선택함으로써 다양성을 증가시킨다.
  • 최종 예측은 모든 트리의 출력에 대해 가중치를 부여한 합으로 이루어지며, 이 가중치는 오분류 오차에 기반해 적응적으로 학습되며, AdaBoost 원칙을 따르는 방식이다.
  • 일관된 85번째 백분율 임계값을 분류 기준 점수의 선택 영역으로 사용하여 이전 연구와의 공정한 비교를 가능하게 한다.
  • 분할의 무작위성과 부트스트랩 샘플링을 통해 트리 간 상관관계를 최소화함으로써 앙상블의 다양성을 높이고 과적합을 줄인다.
  • 이 방법은 고에너지물리학 분류의 표준 벤치마크인 2014년 힉스 ML 챌린지 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ1단일 프레임워크 내에서 배깅과 부스팅을 조합함으로써 부스팅된 결정트리의 강건성과 성능을 입자물리학 분류에서 향상시킬 수 있는가?
  • RQ2겹치는 클래스와 불균형 클래스를 포함한 HEP 데이터셋에서, 부스팅된 앙상블 내 트리의 다양성이 분류 성능에 어떤 영향을 미치는가?
  • RQ3심층신경망(DNN)이 요구하는 막대한 계산 자원 없이도 더 단순하고 해석 가능한 트리 기반 앙상블이 ATLAS 힉스 → 타우-타우 데이터셋에서 DNN의 성능을 뒤지지 않을 수 있는가?
  • RQ4고차원적이고 노이즈가 많은 HEP 데이터에서 표준 BDT에 비해 제안된 BXT 방법이 과적합을 얼마나 줄이는가?
  • RQ5BXT의 향상된 성능는 일반화 능력 향상 때문인가, 아니면 앙상블 내 다양성 증가 때문인가?

주요 결과

  • BXT 모델은 ATLAS 힉스 → 타우-타우 데이터셋에서 약 3.79361σ의 Approximate Median Significance(AMS)를 기록하여 우승한 DNN 앙상블 점수 3.8058σ에 매우 근접한 성능을 달성했다.
  • BXT 방법은 개별 트리 간 상관관계가 낮아 표준 BDT보다 과적합이 줄어든 것으로 나타나, 과적합 감소를 입증했다.
  • 20×100개의 트리를 학습하는 데 BXT는 CPU 기준 983.26초가 소요되었으며, 이는 GPU에서 70개의 DNN 각각 약 600초가 소요되는 것보다 훨씬 더 계산 효율적이다.
  • BXT 앙상블는 표준 BDT보다 트리 간 상관관계가 낮아 더 높은 탈상관성(De-correlation)을 보였으며, 이는 다양성 향상과 일반화 능력 향상을 시사한다.
  • 백색 상자 모델인 BXT를 사용해 최신 기술 수준에 근접한 성능를 달성했으며, 이는 고성능 HEP 분류에서 항상 DNN이 필요한 것은 아님을 시사한다.
  • 결과적으로 부스팅과 배깅을 하나의 프레임워크에서 통합함으로써 단순하고 강건한 학습기인 결정트리로부터도 상당한 성능 향상을 얻을 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.