Skip to main content
QUICK REVIEW

[論文レビュー] Benchmarking Machine Learning Techniques with Di-Higgs Production at the LHC

B. Tannenwald, C. Neu|arXiv (Cornell University)|Sep 14, 2020
Particle physics theoretical and experimental studies参考文献 4被引用数 4
ひとこと要約

この論文は、HL-LHCにおける二ヒッグスボソン生成(hh → bb̄bb̄)を同定するため、伝統的なブーストド決定木から深層ニューラルネットワークおよびオートエンコーダーに至る多様な機械学習手法をベンチマークしている。14 TeVの陽子-陽子衝突を3000 fb⁻¹の光度でシミュレートした結果、畳み込みニューラルネットワーク(CNN)が2.85 ± 0.02の最高の有意性を達成した。これは、古典的なカットや教師なしオートエンコーダー(有意性0.81 ± 0.01)を著しく上回り、潜在空間における信号と背景の分離が不十分であることが要因である。

ABSTRACT

Many domains of high energy physics analysis are starting to explore machine learning techniques. Powerful methods can be used to identify and measure rare processes from previously insurmountable backgrounds. One of the most profound Standard Model signatures still to be discovered at the LHC is the pair production of Higgs bosons through the Higgs self-coupling. The small cross section of this process makes detection very difficult even for the decay channel with the largest branching fraction ($hh ightarrow b\bar{b}b\bar{b}$). This paper benchmarks a variety of approaches (boosted decision trees, various neural network architectures, semi-supervised algorithms) against one another to catalog a few of the various techniques available to high energy physicists as the era of the HL-LHC approaches.

研究の動機と目的

  • HL-LHCにおける主要なbb̄bb̄崩壊モードでのレアな二ヒッグス生成を同定するため、多様な機械学習手法を評価・比較すること。
  • 理想的なゼロピルアップ条件下で、教師ありおよび教師なしML手法の性能を評価することにより、HL-LHC環境を模擬する。
  • どのアーキテクチャが支配的なQCDマルチジェット背景からレアな二ヒッグス信号を最も効果的に分離できるかを特定すること。
  • 従来の運動量的カットに比べて、現代のML技術による感度向上を文書化することで、将来的な高エネルギー物理学解析の基準を提供すること。

提案手法

  • 二ヒッグス(hh → bb̄bb̄)およびQCDマルチジェット背景のイベントは、MadGraph v2.7.0で生成され、Pythia v8.2.44でシャワリング処理が施され、Phase-II CMS検出器を想定したDelphes v3.0で再構成された。
  • 多様なMLモデルを訓練した:ブーストド決定木、順方向および畳み込みニューラルネットワーク、ランダムフォレスト、k-meansクラスタリング、ピアソンフォローネットワーク、およびReLUおよびシグモイド活性化関数を用いたL2正則化付きのオートエンコーダー。
  • オートエンコーダーはQCDイベントを教師なしで学習させ、圧縮された潜在表現を学習し、信号イベントは再構成誤差が高くなることが期待された。
  • 有意性はσ = N_signal / √N_backgroundとして計算され、全積分光度3000 fb⁻¹に正規化され、統計的不確実性が伝搬された。
  • すべてのモデルはゼロピルアップ条件下で評価され、信号および背景イベント数と選別カット後の有意性が報告された。
  • ピルアップなしで最小限のハドロン的活動カットを適用した簡略化されたイベント生成を用い、MLアーキテクチャの信号識別性能への影響を分離した。

実験結果

リサーチクエスチョン

  • RQ1ゼロピルアップ条件下で、支配的なQCDマルチジェット背景に埋もれた二ヒッグス生成(hh → bb̄bb̄)を同定する際、どの機械学習アーキテクチャが最高の有意性を達成するか?
  • RQ2トレーニング時にラベルが使用されない場合、オートエンコーダーなどの教師なし手法は、教師ありモデルに比べてどの程度の性能を示すか?
  • RQ3畳み込みニューラルネットワークやピアソンフォローネットワークのような深層学習アーキテクチャは、従来の運動量的カットや木ベースのモデルに比べてどの程度優れているか?
  • RQ4モデル固有の特徴や潜在空間表現は、高次元の位相空間における信号と背景イベントの分離にどのように寄与するか?
  • RQ5HL-LHCの高ピルアップ環境で予想される再構成の課題に対して、さまざまなML手法はどの程度のロバストネスを示すか?

主な発見

  • 畳み込みニューラルネットワーク(CNN)は2.85 ± 0.02の最高有意性を達成し、従来の1次元長方形カット(0.82 ± 0.02)や他のモデルを著しく上回った。
  • ピアソンフォローネットワーク(PFN)は1.62 ± 0.01の有意性を達成し、再構成されたジェットおよび粒子レベル入力を用いても強力な性能を示した。
  • ランダムフォレストモデルは2.44 ± 0.19の有意性を達成し、信号イベント544.7 ± 6.3個と背景イベント50,000個を保持しており、信号の保持が顕著に優れていた。
  • 教師なし手法としてのオートエンコーダーは、わずか0.81 ± 0.01の有意性にとどまり、潜在空間における信号と背景の分離が不十分である(誤差分布が重複)ことが示された。
  • ブーストド決定木は1.84 ± 0.09の有意性を達成し、信号イベント986.3 ± 8.9個と背景イベント280,000個を示し、古典的カットに比べて中程度の改善を示した。
  • すべての結果はゼロピルアップ条件下で得られたため、再構成依存のモデルはHL-LHCの高ピルアップ環境では著しく性能を落とす可能性があり、CNNやPFNのようなモデルに依存しないアプローチが好ましいと考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。