Skip to main content
QUICK REVIEW

[논문 리뷰] Converging High-Throughput and High-Performance Computing: A Case Study.

Alessio Angius, D. Oleynik|arXiv (Cornell University)|2017. 04. 04.
Distributed and Parallel Computing Systems인용 수 3
한 줄 요약

이 논문은 ATLAS가 기존의 고-throughput 컴퓨팅 인프라와 함께 티탄 리더십 클래스 슈퍼컴퓨터를 통합한 사례 연구를 제시하며, 연간 약 5100만 코어시간의 지속적인 생산 워크로드를 달성한다. 이는 확장 가능한 슈퍼컴퓨터 사용을 위한 설계 및 운영 전략을 평가하고, 고도화된 워크로드를 지원하기 위한 차세대 PanDA 엑스큐터를 도입하며, 실험 시스템을 생산용 슈퍼컴퓨팅 플랫폼과 통합하기 위한 프레임워크를 수립한다.

ABSTRACT

The computing systems used by LHC experiments has historically consisted of the federation of hundreds to thousands of distributed resources, ranging from small to mid-size resource. In spite of the impressive scale of the existing distributed computing solutions, the federation of small to mid-size resources will be insufficient to meet projected future demands. This paper is a case study of how the ATLAS experiment has embraced Titan -- a DOE leadership facility in conjunction with traditional distributed high-throughput computing to reach sustained production scales of approximately 51M core-hours a years. The three main contributions of this paper are: (i) a critical evaluation of design and operational considerations to support the sustained, scalable and production usage of Titan; (ii) a preliminary characterization of a next generation executor for PanDA to support new workloads and advanced execution modes; and (iii) early lessons for how current and future experimental and observational systems can be integrated with production supercomputers and other platforms in a general and extensible manner.

연구 동기 및 목표

  • 리더십 클래스 슈퍼컴퓨터인 티탄을 고에너지 물리학 분야에서 지속적이고 대규모의 생산 워크로드를 위해 사용하는 데 있어 설계 및 운영 과제를 평가하기 위해.
  • 미래의 워크로드와 고도화된 실행 모드를 지원하기 위해 차세대 PanDA 워크로드 관리 시스템 엑스큐터를 개발하고 특성화하기 위해.
  • 실험 및 관측 시스템을 생산용 슈퍼컴퓨팅 플랫폼과 통합하기 위한 일반적이고 확장 가능한 프레임워크를 수립하기 위해.
  • 고-throughput 컴퓨팅과 고성능 컴퓨팅을 생산 환경에서 융합하는 것의 실현 가능성과 성능을 평가하기 위해.

제안 방법

  • 오라클 리서치 랩의 리더십 클래스 슈퍼컴퓨터인 티탄과 ATLAS 워크로드 관리 시스템(PanDA)의 통합.
  • 티탄의 아키텍처와 작업 제출 워크플로우를 지원하기 위해 PanDA의 작업 실행 및 스케줄링 컴포onent를 적응시킴.
  • 저지연성 또는 고병렬성 실행을 요구하는 다양한 워크로드를 처리할 수 있도록 설계 및 평가한 새로운 엑스큐터 모듈의 개발.
  • ATLAS 실험의 실제 생산 워크로드를 사용하여 하이브리드 HPC-HTC 환경의 성능 특성 분석.
  • 지속적인 생산 환경에서 티탄에서의 작업 제출, 모니터링, 장애 복구 패턴에 대한 운영 분석.
  • 고-throughput 및 고성능 컴퓨팅 플랫폼 간 상호운용성을 가능하게 하는 확장 가능한 소프트웨어 스택 개발.

실험 결과

연구 질문

  • RQ1리더십 클래스 슈퍼컴퓨터인 티탄을 어떻게 효과적이고 지속 가능하게 기존의 고-throughput 컴퓨팅 인fra와 통합하여 대규모 과학적 워크로드를 처리할 수 있는가?
  • RQ2PanDA와 같은 고-throughput 컴퓨팅 프레임워크 내에서 슈퍼컴퓨터를 생산 수준에서 사용하기 위해 필요한 아키텍처적 및 운영적 변화는 무엇인가?
  • RQ3현대 과학적 워크로드가 요구하는 다양한 실행 모드를 지원하기 위해 차세대 PanDA 엑스큐터는 어떻게 설계할 수 있는가?
  • RQ4생산용 HEP 환경에서 리더십 클래스 슈퍼컴퓨터에서 지속적이고 대규모의 워크로드를 실행할 때의 주요 과제와 성능 특성은 무엇인가?
  • RQ5다양한 HPC 및 HTC 플랫폼과의 원활한 통합을 가능하게 하기 위해 도출할 수 있는 일반적인 패턴과 추상화는 무엇인가?

주요 결과

  • 티탄을 ATLAS의 고-throughput 컴퓨팅 인프라와 통합함으로써 연간 약 5100만 코어시간의 지속적인 생산 워크로드를 달성하였다.
  • 티탄을 생산 환경에서 사용하기 위한 설계 및 운영 고려사항이 성공적으로 평가되었으며, 장기간에 걸쳐 확장성과 신뢰성을 입증하였다.
  • 차세대 PanDA 엑스큐터가 개발되고 특성화되었으며, 새로운 워크로드 패턴과 실행 모드를 지원할 수 있게 되었다.
  • 하이브리드 HPC-HTC 환경은 다양한 컴퓨팅 자원을 통해 높은 자원 활용도와 효과적인 작업 관리를 달성하였다.
  • 이 연구는 향후 HEP 및 관측 과학 워크로드에 적용 가능한 일반적이고 확장 가능한 실험 시스템과 생산용 슈퍼컴퓨팅 플랫폼 간의 통합 프레임워크를 수립하였다.
  • 초기 운영 교훈으로는 대규모 HPC-HTC 워크플로우에서 자동 모니터링, 장애 내성, 동적 자원 할당의 중요성이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.