[논문 리뷰] A Portable Parton-Level Event Generator for the High-Luminosity LHC
이 논문은 고광도 LHC를 위한 이식성 있고 하드웨어에 종속되지 않는 파arton 수준 이벤트 생성기인 Pepper를 제시한다. 이는 최신 컴퓨팅 아키텍처인 CPU, GPU, 가속기 등에 최적화되어 있으며, H100 GPU에서 톰-쿼크 쌍 생성과 4개의 제트를 포함한 과정에서 시간당 최대 29억 개의 무게 조정이 없는 이벤트를 생성하여 기존 프레임워크에 비해 성능과 지속 가능성 면에서 크게 향상되었으며, 기존 시뮬레이션 파이프라인과 완전히 호환된다.
Profiling results for top pair plus jets production with Pepper v1.1.1 Contents This includes data/output for the following GPU accelerated unweighted event generation runs: A run over a few seconds to produce pepper-internal timing results (`*timers.csv` files) The same run, but with `nvprof` (`*.nvprof` files) A run with a single event batch, with `ncu --import-source on --set full` (`*.ncu-rep` files) The simulated process is top pair production with n jets, with n = 0...4, at 13 TeV. The configuration files (`pepper.ini`) are included. Also the `pepper_cache` directories are included. All results are for the "main" pepper variant (which uses Kokkos to utilise the GPU) and for the "native" pepper variant (which uses CUDA directly). Software stack and CPU/GPU hardware details The software/hardware used for the profiling are as follows: GPU Driver: NVIDIA-SMI: 550.100, Driver Version: 550.100, CUDA Version: 12.4 GPU: Tesla V100S-PCIE-32GB Cuda compilation tools: release 11.6, V11.6.124 Kokkos 4.3.01 gcc (GCC) 11.4.1 20231218 (Red Hat 11.4.1-3) Intel(R) Xeon(R) Silver 4214R CPU @ 2.40GHz Note that the event generation includes write-out of event files. The LHEH5 files are written to local SSD storage. The event files are not included in this dataset. Additional run parameters TTBar number of batches batch size rate (main variant) rate (native variant) +0j 20 1,179,648 1.4e10 2.0e10 +1j 20 1,179,648 1.5e10 2.4e10 +2j 20 1,179,648 * 2 1.3e10 2.7e10 +3j 20 1,179,648 / 2 6.4e9 1.4e10 +4j 20 1,179,648 2.2e9 2.2e9 The number of batches has been chosen such that the most important sub processes are samples and such that the overall runtime is at least a few seconds. The batch size has been chosen by scanning over factors of two and picking the best-performing batch size with the native variant. The event rate is the number given in the Pepper output. It does not include the closing time of the generated HDF5 file, which can be significant for the two lowest multiplicities. This can be checked by inspecting the corresponding relative and absolute timing results in the `*timing.csv` files included in the dataset.
연구 동기 및 목표
- 고광도 LHC 시뮬레이션에서 파arton 수준의 이벤트 생성에 대한 점점 커지는 계산적 및 환경적 부담을 해결하기 위해.
- GPU 및 가속기를 포함한 다양한 현대 하드웨어에서 효율적이고 이식성 있고 확장 가능한 이벤트 생성을 가능하게 하기 위해.
- 성능 향상과 자원 활용도 향상을 통해 몬테카를로 시뮬레이션의 탄소 발자국을 줄이기 위해.
- 기존 충돌기 현상학 파이프라인과 호환되는 생산 준비 완료된 오픈소스 프레임워크를 제공하기 위해.
- 고제트 다중도에서 낮은 무게 조정 효율성으로 인한 성능 저하 문제를 알고리즘적 및 하드웨어 인지 최적화를 통해 해결하기 위해.
제안 방법
- C++와 CUDA를 사용하여 하드웨어에 종속되지 않는 모듈식 아키텍처를 구현하여 다중 플랫폼 배포를 가능하게 한다.
- 해석적 해법과 신경망 기반 샘플링을 활용한 적응형 위상공간 통합을 통해 효율성을 향상시킨다.
- 최적화된 스핀극성 합산과 주요 색상 프로젝션을 사용한 Berends–Giele 재귀를 통해 행렬 요소를 계산한다.
- 여러 코어와 장치를 통해 이벤트 생성을 병렬화하고, I/O 버퍼를 최소화하기 위해 구성 가능한 출력 파이프라인을 제공한다.
- 동적 로드 밸런싱을 지원하며, 고정밀도 샘플링을 위한 Chili 위상공간 생성기와 통합된다.
- 경량 이벤트 데이터 레이아웃을 사용하고 비동기 I/O를 지원하여 계산과 스토리지 간의 분리 구현을 가능하게 한다.

실험 결과
연구 질문
- RQ1일관된 이식성 있는 이벤트 생성기가 고다중도 LHC 과정에 대해 CPU와 GPU를 포함한 다양한 하드웨어 플랫폼에서 고성능을 달성할 수 있는가?
- RQ2Comix와 같은 기존 도구와 비교해 새로운 프레임워크의 이벤트 생성 속도와 자원 효율성은 어떠한가?
- RQ3하드웨어에 종속되지 않는 설계가 고에너지 물리학 시뮬레이션에서 이식성과 지속 가능성에 얼마나 기여하는가?
- RQ4현대 이벤트 생성에서 주요 성능 저하 요인은 무엇이며, 이는 이질적 아키텍처에서 어떻게 완화될 수 있는가?
- RQ5Pepper는 $t\bar{t}+4j$ 또는 $Z+5j$와 같은 5개의 추가 제트를 포함한 과정에서도 높은 무게 조정 효율성을 유지할 수 있는가?
주요 결과
- Pepper는 NVIDIA H100 GPU에서 $pp \to t\bar{t}+4j$ 과정에 대해 시간당 최대 29억 개의 무게 조정이 없는 이벤트를 생성하여 CPU 전용 기준 대비 2.5배 향상된 성능을 기록했다.
- $pp \to e^+e^-+5j$ 과정에서 Pepper는 H100에서 시간당 13,000개의 이벤트를 생성했고, CPU에서는 단지 380개에 그쳐 34배의 속도 향상을 보였다.
- 2× Skylake8180 CPU에서 Pepper는 Comix가 비표준이지만 최적화된 모드로 실행되는 경우에도 이벤트 생성 속도에서 최대 35% 향상을 기록했다.
- GPU에서는 저다중도 과정에서 이벤트 출력이 단일 스레드 I/O로 인해 주요 성능 저하 요인으로 나타나며, 다중 코어 I/O 오프로딩이 필요함을 시사한다.
- Pepper는 CPU 클러스터와 페르미랩의 윌슨 클러스터와 같은 GPU 가속 시스템 모두에서 다수의 노드에 걸쳐 효율적으로 확장 가능하며 뛰어난 성능을 보였다.
- 런타임 프로파일링 결과, CPU에서는 행렬 요소 평가가 주요 성능 요소였고, GPU에서는 I/O가 지배적이었으며, 향후 버전에서 최적화된 I/O 파이프라인 개발이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.