Skip to main content
QUICK REVIEW

[論文レビュー] Data Augmentation at the LHC through Analysis-specific Fast Simulation with Deep Learning

Cheng Chen, Olmo Cerri|arXiv (Cornell University)|Oct 5, 2020
Particle physics theoretical and experimental studies参考文献 16被引用数 5
ひとこと要約

この論文は、検出器のエネルギー分解能効果をジェネレータレベルの特徴量に対する転送関数としてモデル化する深層学習ベースの高速シミュレーション手法を提案している。これにより、約10倍の計算コストおよびストレージコスト削減が達成され、分析固有のデータ拡張が可能になる。本手法は、ジェネレータレベルの入力から検出器レベルの観測量を予測するためのニューラルネットワークを訓練し、大規模なデータセットに対しても高い忠実性と頑健性を達成しており、High-Luminosity LHC時代におけるスケーラブルなソリューションを提供する。

ABSTRACT

We present a fast simulation application based on a Deep Neural Network, designed to create large analysis-specific datasets. Taking as an example the generation of W+jet events produced in sqrt(s)= 13 TeV proton-proton collisions, we train a neural network to model detector resolution effects as a transfer function acting on an analysis-specific set of relevant features, computed at generation level, i.e., in absence of detector effects. Based on this model, we propose a novel fast-simulation workflow that starts from a large amount of generator-level events to deliver large analysis-specific samples. The adoption of this approach would result in about an order-of-magnitude reduction in computing and storage requirements for the collision simulation workflow. This strategy could help the high energy physics community to face the computing challenges of the future High-Luminosity LHC.

研究の動機と目的

  • LHC実験におけるフルGEANT4ベースのシミュレーションワークフローの増大する計算およびストレージ負荷に対処する。
  • 特に高精度測定のための合成衝突データ生成に必要なリソース要件を低減する。
  • 下流の再結合ソフトウェアと互換性のある、高速で分析固有のシミュレーション手法を開発する。
  • フル検出器シミュレーションに依存せずに、複雑な物理解析のための大規模なデータ拡張を可能にする。
  • LHCコミュニティがHigh-Luminosity LHCフェーズの計算課題に対応できるように支援する。

提案手法

  • 分析固有のジェネレータレベル特徴量に対して作用する転送関数として、検出器分解能効果をモデル化する深層ニューラルネットワークを訓練する。
  • ガウス分布サンプリングを用いた回帰ベースのアーキテクチャを採用し、ジェネレータレベルの入力から現実的な検出器レベルの観測量を生成する。
  • 完全なイベント画像ではなく、関連する物理量の最小限のセット(例:再結合されたオブジェクトの4元運動量)に焦点を当てる。
  • 理想化された粒子レベルの入力を検出器レベルの出力にマッピングするための学習を、大規模なジェネレータレベルデータセット上で行う。
  • フルGEANT4シミュレーションを実行せずに、訓練済みモデルを用いて大規模な分析固有のデータセットを生成する。
  • 複数の特徴タイプにわたり、シミュレートされた量と予測された量の相対残差分布を用いて、モデルの妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1フルGEANT4シミュレーションを用いずに、ジェネレータレベルの入力から検出器レベルの観測量を正確に予測できるか?
  • RQ2トレーニングセットよりも著しく大きなデータセットに適用した場合、モデルの精度はどの程度維持されるか?
  • RQ3計算およびストレージ効率の観点から、本手法は従来のシミュレーション手法と比べてどのように差がつくか?
  • RQ4最小限の系統的不確実性で、大規模で分析固有のデータセットを生成するために本モデルを用いることができるか?
  • RQ5High-Luminosity LHC時代における高精度測定をサポートするのに十分な頑健性を本モデルは有しているか?

主な発見

  • 提案手法は、フルGEANT4シミュレーションと比較して、計算およびストレージ要件の両方で約1桁の削減を達成した。
  • 高い精度を維持しており、入力および補助的特徴量の両方の予測において、強い相関性と対角線を中心に対称的な残差分布が観察された。
  • トレーニングセットの5倍の大きさのデータセットに対しても、性能の劣化が観察されず、良好な一般化性能を示した。
  • ガウス分布サンプリングを用いた回帰ベースのアプローチは、生成対向ネットワーク(GANs)と比較して、良好な性能を発揮するとともに、より単純で安定性に優れている。
  • 軽量な推論およびトレーニングが可能であり、アンサンブルモデル化が可能となり、予測のばらつきを用いた系統的不確実性の推定が可能になった。
  • 本手法は標準的な解析ワークフローと互換性があり、下流の再結合ソフトウェアが使用可能な形式でデータを出力することができる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。