Skip to main content
QUICK REVIEW

[論文レビュー] Extracting more from boosted decision trees: A high energy physics case study

Vidhi Lalchand|arXiv (Cornell University)|Jan 16, 2020
Particle physics theoretical and experimental studies参考文献 12被引用数 5
ひとこと要約

本稿では、高エネルギー物理学(HEP)における粒子識別のためのブースティングとバギングを組み合わせた、新たなアンサンブル手法であるブーストド・エクストリームリーマンドツリー(BXT)を提案する。木の分割におけるランダムネスとブートストラップサンプリングを導入することで、過学習を低減し汎化性能を向上させ、ATLASヒッグス→タウタウデータセットにおいてAMSスコア3.79361σを達成した。これは、3.8058σの優勝DNNアンサンブルスコアに非常に近く、計算コストはDNNよりも顕著に低い。

ABSTRACT

Particle identification is one of the core tasks in the data analysis pipeline at the Large Hadron Collider (LHC). Statistically, this entails the identification of rare signal events buried in immense backgrounds that mimic the properties of the former. In machine learning parlance, particle identification represents a classification problem characterized by overlapping and imbalanced classes. Boosted decision trees (BDTs) have had tremendous success in the particle identification domain but more recently have been overshadowed by deep learning (DNNs) approaches. This work proposes an algorithm to extract more out of standard boosted decision trees by targeting their main weakness, susceptibility to overfitting. This novel construction harnesses the meta-learning techniques of boosting and bagging simultaneously and performs remarkably well on the ATLAS Higgs (H) to tau-tau data set (ATLAS et al., 2014) which was the subject of the 2014 Higgs ML Challenge (Adam-Bourdarios et al., 2015). While the decay of Higgs to a pair of tau leptons was established in 2018 (CMS collaboration et al., 2017) at the 4.9$σ$ significance based on the 2016 data taking period, the 2014 public data set continues to serve as a benchmark data set to test the performance of supervised classification schemes. We show that the score achieved by the proposed algorithm is very close to the published winning score which leverages an ensemble of deep neural networks (DNNs). Although this paper focuses on a single application, it is expected that this simple and robust technique will find wider applications in high energy physics.

研究の動機と目的

  • 高エネルギー物理学(HEP)分類における主要な弱みである、標準的ブーストド意思決定木(BDT)の過学習問題に対処すること。
  • 重複するクラスや不均衡なクラスを含む粒子識別タスクにおける性能を向上させること。これは、HEPデータセットで一般的な特徴である。
  • ブースティング(バイアス低減)とバギング(分散低減)の長所を統合した単一のフレームワーク内で組み合わせること。
  • シンプルで解釈可能なモデル(例:BXT)が、ベンチマーク用HEPデータセットにおいて、深層ニューラルネットワーク(DNN)と同等の性能を達成できることを示すこと。

提案手法

  • 本手法は、各ブースティング段階でデータのブートストラップサンプルを用いて学習する、BDTの変種であるブーストド・エクストリームリーマンドツリー(BXT)を導入する。
  • 各ブースティング反復において、ベースラーナー(極めてランダム化された木)がブートストラップサンプル上で訓練され、特徴量のスプリットが特徴量の値の範囲内でランダムに選ばれ、木の多様性を高める。
  • 最終的な予測は、誤分類誤差に基づいて適応的に学習される重みを用いた、すべての木の出力の重み付き和である。これはアダブーストの原則に従う。
  • 一貫性のある85パーセンタイルの閾値を判別スコアに用いて選択領域を定義することで、先行研究との公平な比較を可能にする。
  • スプリットのランダム化とブートストラップサンプリングにより、木同士の相関を低減し、アンサンブルの多様性を高め、過学習を軽減する。
  • 本手法は、HEP分類の標準ベンチマークとして用いられる2014年ヒッグスMLチャレンジデータセットで評価された。

実験結果

リサーチクエスチョン

  • RQ1単一のフレームワーク内でバギングとブースティングを組み合わせることで、素粒子物理学分類におけるブーストド意思決定木のロバスト性と性能が向上するか?
  • RQ2重複するクラスや不均衡なクラスを含むHEPデータセットにおいて、ブーストドアンサンブル内の木の多様性が分類性能に与える影響は何か?
  • RQ3DNNに比べて膨大な計算リソースを要しない条件下で、よりシンプルで解釈可能なモデル(例:BXT)が、ATLASヒッグス→タウタウデータセットでDNNの性能を凌駆できるか?
  • RQ4高次元かつノイズの多いHEPデータにおいて、提案手法BXTは標準BDTに比べてどの程度過学習を低減するか?
  • RQ5BXTの向上した性能は、一般化性能の向上によるものか、アンサンブル内の多様性の増加によるものか?

主な発見

  • BXTモデルは、ATLASヒッグス→タウタウデータセットで3.79361σの近似中央値有意度(AMS)を達成し、優勝DNNアンサンブルの3.8058σに非常に近い性能を示した。
  • BXTは、アンサンブル内の個々の木同士の相関が低いことから、標準BDTに比べて過学習が低減していることが裏付けられた。
  • 20×100本の木を学習するためのCPU訓練時間は983.26秒であり、GPU上で70本のDNN(1本あたり600秒)を学習するのに比べ、顕著に計算コストが低かった。
  • BXTアンサンブルは、標準BDTよりも木同士の相関が低く、多様性が高まっており、一般化性能が向上していることが示された。
  • 本手法は、白箱モデルであり解釈可能なモデルを用いて、SOTAに近い性能を達成した。これは、高性能なHEP分類においてDNNが常に必要ではない可能性を示唆している。
  • 本結果は、ブースティングとバギングを統合したフレームワークにより、意思決定木のようなシンプルで頑健な学習器からも、顕著な性能向上が得られることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。