Skip to main content
QUICK REVIEW

[논문 리뷰] LHCb's Forward Tracking algorithm for the Run 3 CPU-based online track-reconstruction sequence

P. A. Günther|arXiv (Cornell University)|2022. 07. 26.
Particle physics theoretical and experimental studies인용 수 4
한 줄 요약

이 논문은 LHCb의 Run 3 CPU 기반 고수준 트리거(HLT2)의 핵심 구성 요소인 포워드 트래킹 알고리즘을 제시한다. 실시간으로 전체 이벤트 재구성하는 데 사용되며, AVX2 명령어를 통한 SIMD 벡터화를 활용해 사이피피 트래커에서의 트랙 재구성 속도를 가속화한다. 재구성 효율성에 손상이 가지 않고 가짜 트랙 비율이 증가하지 않으면서도, 처리량을 60% 향상시켜 계산 노드당 초당 500건 이상의 이벤트 처리를 가능하게 한다.

ABSTRACT

In Run 3 of the LHC the LHCb experiment faces very high data rates containing beauty and charm hadron decays. Thus the task of the trigger is not to select any beauty and charm events, but to select those containing decays interesting for the LHCb physics programme. LHCb has therefore implemented a real-time data processing strategy to trigger directly on reconstructed events. The first stage of the purely software-based trigger is implemented on GPUs performing a partial event reconstruction. In the second stage of the software trigger, the full, offline-quality event reconstruction is performed on CPUs, with a crucial part being track reconstruction, balancing track finding efficiency, fake track rate and event throughput. LHCb's CPU-based track reconstruction sequence for Run 3 is presented, highlighting the "Forward Tracking", which is the algorithm that reconstructs trajectories of charged particles traversing all of LHCb's tracking detectors. To meet event throughput requirements, the "Forward Tracking" uses SIMD instructions in several core parts of the algorithm, such as the Hough transform and the cluster search. These changes led to an improvement of the algorithm's event throughput by 60%.

연구 동기 및 목표

  • LHCb Run 3에서 초과하는 데이터 속도를 해결하기 위해, 매초 수백만 개의 뷰티 및 셀레스트 하드론 붕괴로 인해 기존 하드웨어 트리거의 용량을 초과하는 상황를 다루기 위해.
  • CPU만을 사용하여 실시간으로 온라인 수준의 품질을 갖춘 전체 이벤트 재구성을 HLT2 단계에서 수행하기 위해, 높은 이벤트 처리량과 낮은 지연 시간을 요구한다.
  • 장거리 트랙 재구성에서의 중복을 줄이기 위해, 포워드 트래킹이 매칭 알고리즘에 의해 매칭되지 않은 잔여 VELO 트랙만 처리하도록 보장한다.
  • 재구성 품질을 떨어뜨리지 않고 SIMD 명령어를 통한 데이터 수준 병렬 처리를 활용해 CPU 처리량 최적화를 수행한다.
  • HLT2 재구성 시퀀스에서 계산 노드당 초당 500건 이상의 이벤트 처리량을 달성하기 위해.

제안 방법

  • 포워드 트래킹 알고리즘은 히트 데이터를 기반으로 선형 패턴을 식별함으로써 충전 입자 궤적을 재구성한다. 이는 허프 변환 유사 방법을 사용한다.
  • 256비트 AVX2 SIMD 레지스터를 활용해 다중 히트 및 히스토GRAM 버킷을 동시에 처리함으로써, 8개의 32비트 부동소수점 또는 정수 값을 한 번의 명령어로 다중 데이터 연산할 수 있다.
  • 메모리 대역폭을 극대화하고 SIMD 레지스터에 효율적으로 로딩하기 위해 데이터 구조를 배열의 구조(Structure-of-Arrays) 형태로 구성한다.
  • 알고리즘의 계산 부담이 가장 큰 맵-리듀스 단계(히트를 기준 평면에 매핑하고 임계값 스캔 수행)에 초점을 맞추며, 이 단계에서 SIMD 최적화가 가장 큰 성능 향상을 가져온다.
  • 매칭 알고리즘에 의해 매칭되지 않은 잔여 VELO 트랙을 시드로 사용하여, 오직 SciFi 히트만을 사용해 장거리 트랙으로 연장한다.
  • 전체 HLT2 재구성 파이프라인은 칼만 필터를 통한 트랙 피팅과 입자 식별을 포함하며, 포워드 트래킹은 전체 처리량 목표 달성에 기여한다.

실험 결과

연구 질문

  • RQ1포워드 트래킹 알고리즘이 재구성 효율성과 낮은 가짜 트랙 비율을 유지하면서 LHCb의 Run 3 HLT2 재구성에서 높은 이벤트 처리량을 달성하는 방법은 무엇인가?
  • RQ2SIMD 병렬 처리가 트랙 재구성 파이프라인의 가장 계산 집약적인 부분을 가속화하는 데 어떤 역할을 하는가?
  • RQ3T 트랙과의 매칭 후 잔여 VELO 트랙을 처리할 때 알고리즘의 성능 스케일링은 어떻게 되는가?
  • RQ4데이터 레이아웃(배열의 구조)이 트랙 재구성에서 SIMD 벡터화 효율성에 어떤 영향을 미치는가?
  • RQ5실시간 CPU 기반 트리거 시스템에서 재구성 품질을 손상시키지 않고 AVX2 벡터화가 처리량을 얼마나 향상시킬 수 있는가?

주요 결과

  • 포워드 트래킹 알고리즘은 AVX2 SIMD 명령어를 활용해 재구성 효율성에 손상이 가지 않고 가짜 트랙 비율이 증가하지 않으면서도 이벤트 처리량을 60% 향상시켰다.
  • B 메손 붕괴에서 유래한 입자에 대해 장거리 트랙 재구성 효율성이 약 90%를 유지하며, 10 GeV/c 이상의 운동량을 가진 입자는 95% 이상으로 상승한다.
  • 포워드 트래킹 단독으로 통합된 가짜 트랙 비율은 15%이며, 이후 칼만 필터링과 전용 가짜 트랙 분류기로 감소된다.
  • 포워드 트래킹, 칼만 필터링, 입자 식별을 포함한 HLT2 재구성 시퀀스는 계산 노드당 초당 500건 이상의 이벤트 처리량을 달성한다.
  • 성능 향상은 주로 알고리즘의 맵-리듀스 단계에서 발생하며, 이 단계에서는 256비트 SIMD 레지스터를 사용해 다중 히트 및 히스토GRAM 버킷을 동시에 처리한다.
  • 배열의 구조 데이터 레이아웃은 SIMD 레지스터에 대한 데이터 로딩 및 저장을 효율적으로 가능하게 하며, 이는 벡터 연산을 통한 고처리량 달성에 핵심적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.