Skip to main content
QUICK REVIEW

[논문 리뷰] Supervision of the ATLAS High Level Trigger System

S. Wheeler, J. Flammer|arXiv (Cornell University)|2003. 05. 28.
Distributed and Parallel Computing Systems인용 수 3
한 줄 요약

이 논문은 CERN의 LHC 실험에서 프로토타입 테스트 중에 복잡한 HLT 워크로드를 처리하는 데 있어 확장성과 신뢰성을 입증한, ATLAS 고수준 트리거(HLT)를 위한 감시 시스템을 제시한다. 이 시스템은 230개 노드에 분산된 1,000개 이상의 소프트웨어 프로세스의 구성, 조율, 제어 및 모니터링을 가능하게 하며, ATLAS 온라인 소프트웨어 도구를 기반으로 구축되었다.

ABSTRACT

The ATLAS High Level Trigger (HLT) system provides software-based event selection after the initial LVL1 hardware trigger. It is composed of two stages, the LVL2 trigger and the Event Filter. The HLT is implemented as software tasks running on large processor farms. An essential part of the HLT is the supervision system, which is responsible for configuring, coordinating, controlling and monitoring the many hundreds of processes running in the HLT. A prototype implementation of the supervision system, using tools from the ATLAS Online Software system is presented. Results from scalability tests are also presented where the supervision system was shown to be capable of controlling over 1000 HLT processes running on 230 nodes.

연구 동기 및 목표

  • 수백 개의 분산 소프트웨어 프로세스를 관리할 수 있는 견고한 ATLAS 고수준 트리거(HLT) 감시 시스템을 설계하고 구현하기.
  • 데이터 수확 중 HLT 프로세스의 신뢰할 수 있는 구성, 조율, 제어 및 실시간 모니터링을 보장하기.
  • LHC에 배포하기 전에 실제 HLT 워크로드 조건에서 감시 시스템의 확장성을 검증하기.
  • 기존 ATLAS 온라인 소프트웨어 인fra구조와의 통합을 통해 원활한 운영을 지원하기.
  • ATLAS 실험의 실시간 이벤트 선택에 요구되는 고처리량, 저지연 요구사항을 충족하기.

제안 방법

  • ATLAS 온라인 소프트웨어 시스템의 기존 도구를 활용하여 감시 프레임워크를 구축하였다.
  • 감시 시스템이 대규모 프로세서 팜에서 실행 중인 HLT 프로세스를 관리하는 분산 아키텍처를 구현하였다.
  • 이벤트 선택을 두 단계(LVL2 트리거 및 이벤트 필터)로 처리하기 위해 소프트웨어 작업을 사용하였다.
  • 다양한 노드에 걸쳐 프로세스 상태의 동적 구성 및 모니터링이 가능하도록 시스템을 설계하였다.
  • 230개의 컴퓨팅 노드에 분포된 최대 1,000개의 HLT 프로세스를 대상으로 확장성 테스트를 수행하였다.
  • 시스템의 가시성과 장애 내성 확보를 위해 표준화된 통신 프로토콜 및 로깅 메커니즘을 활용하였다.

실험 결과

연구 질문

  • RQ1중앙집중식 감시 시스템은 실시간으로 수백 개의 분산된 HLT 프로세스를 효과적으로 관리할 수 있는가?
  • RQ2감시 시스템이 성능 저하 없이 HLT 프로세스 관리의 최대 스케일은 어느 정도인가?
  • RQ3LHC 데이터 수확에서 일반적인 고부하 조건에서도 감시 시스템이 신뢰성과 구성 가능성을 유지할 수 있는가?
  • RQ4감시 시스템은 넓은 범위의 ATLAS 온라인 소프트웨어 생태계와 얼마나 잘 통합되는가?
  • RQ5전체 LHC 운영을 고려할 때 감시 시스템의 확장성에서 발생하는 주요 성능 저하 요소는 무엇인가?

주요 결과

  • 확장성 테스트 기간 동안 감시 시스템은 230개 노드에 걸쳐 1,000개 이상의 HLT 프로세스를 성공적으로 조율하고 모니터링하였다.
  • 프로토타입은 고부하 조건에서도 안정적인 운영을 보여주어, 대규모 배포에 대한 시스템의 준비 상태를 확인하였다.
  • ATLAS 온라인 소프트웨어 도구와의 통합을 통해 분산된 HLT 작업의 구성 및 모니터링이 원활하게 이루어졌다.
  • 시스템은 실시간 이벤트 필터링에 필수적인 저지연 응답 시간을 유지하였다.
  • 확장성 테스트를 통해 감시 프레임워크가 ATLAS 실험에서 예상되는 워크로드를 처리할 수 있음을 확인하였다.
  • 해결책은 확장 가능하고 유지보수 용이하여 향후 HLT 아키텍처의 업그레이드를 지원하는 데 성공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.