Skip to main content
QUICK REVIEW

[논문 리뷰] Design and Performance Characterization of RADICAL-Pilot on Titan

André Merzky, Matteo Turilli|arXiv (Cornell University)|2018. 01. 05.
Scientific Computing and Data Management참고 문헌 14인용 수 4
한 줄 요약

이 논문은 테이탄과 같은 리더십 수준의 슈퍼컴퓨터에서 수천 개의 MPI 작업을 확장성 있게 실행할 수 있도록 설계된 이식성 있고 파이썬 기반의 피ilot 시스템인 RADICAL-Pilot (RP)을 제시한다. RP의 성능 및 131,000코어와 4,096개 작업까지의 확장성에 대해 분석하며, OpenMPI 내부의 ORTE가 주요 성능 저하 원인임을 규명하고, 131,000코어를 초과할 경우 실패율이 증가하는 것을 관측하였으며, 최적화를 통해 시스템 소프트웨어에 의해만 제한되는 확장성 확보가 가능함을 확인하였다.

ABSTRACT

Many extreme scale scientific applications have workloads comprised of a large number of individual high-performance tasks. The Pilot abstraction decouples workload specification, resource management, and task execution via job placeholders and late-binding. As such, suitable implementations of the Pilot abstraction can support the collective execution of large number of tasks on supercomputers. We introduce RADICAL-Pilot (RP) as a portable, modular and extensible Python-based Pilot system. We describe RP's design, architecture and implementation. We characterize its performance and show its ability to scalably execute workloads comprised of thousands of MPI tasks on Titan--a DOE leadership class facility. Specifically, we investigate RP's weak (strong) scaling properties up to 131K (65K) cores and 4096 (16384) 32 core tasks. RADICAL-Pilot can be used stand-alone, as well as integrated with other tools as a runtime system.

연구 동기 및 목표

  • 리더십 수준의 HPC 시스템에서 수천 개의 이질적이고 MPI 기반의 작업으로 구성된 대규모 워크로드를 확장성 있게 실행할 수 있는 필요성을 해결하기 위해.
  • 오ak Ridge 리더십 컴퓨팅 시설의 테이탄 슈퍼컴퓨터에서 RADICAL-Pilot (RP)의 성능 및 확장성 행동을 규명하기 위해.
  • 극대규모 워크로드 하에서 작업 실행 및 스케줄링에 특화된 아키텍처의 성능 저하 요인을 특정하고 국소화하기 위해.
  • 동일한 MPI 작업에 최적화된 RP 내부 스케줄러를 개선하여 처리량과 확장성을 향상시키기 위해.
  • 워크플로우 및 애플리케이션 도구와 통합된 런타임 시스템으로서 RP를 생산 환경에서 복잡한 과학 워크로드를 실행할 수 있도록 하기 위해.

제안 방법

  • RADICAL-Pilot (RP)는 작업 명세, 자원 관리 및 작업 실행을 작업 플레이스홀더와 지연 绑정을 통해 분리하는 모듈형이고 확장 가능한 파이썬 기반 피ilot 시스템으로 구현되었다.
  • 시스템은 중앙의 에이전트 모듈이 HPC 자원 전반에서 작업 실행을 조율하는 다단계 스케줄링 방식을 사용하며, 테이탄에서는 SLURM 스케줄러를 활용한다.
  • RADICAL-Analytics와 통합된 고도로 세분화된 프로파일링 및 인스펙션 스택을 통해 RP의 하위 시스템 전반에 걸친 세밀한 성능 모니터링 및 오버헤드 기여도 분석이 가능해졌다.
  • 일반적인 스케줄러의 검색 로직을 제거하고 동일한 작업 집합에 대해 직접 검색을 수행하는 방식으로, 일반적인 검색 로직을 제거함으로써 오버헤드를 감소시킨 전용 최적화 스케줄러를 구현하였다.
  • 실험은 테이탄에서 최대 4,096개의 작업을 사용한 워크로드를 대상으로 수행되었으며, 각 작업은 32개의 코어를 필요로 하였고, 131,000코어까지 확장하여 약화 및 강화 확장성 행동을 평가하였다.
  • 시스템 수준의 프로파일링 및 실패 분석을 통해, 특히 OpenMPI 런타임 환경(ORTE)에서의 성능 저하 요인을 규명하고, 대규모에서의 작업 시작 빈도의 변동성과 실패율을 이해하기 위해 수행되었다.

실험 결과

연구 질문

  • RQ1테이탄에서 수천 개의 MPI 작업을 실행할 때 RADICAL-Pilot의 약화 및 강화 확장성 행동은 어떻게 되는가?
  • RQ2대규모에서 RADICAL-Pilot의 런타임 오버헤드의 주요 원인은 무엇이며, 이를 어떻게 특정하고 완화할 수 있는가?
  • RQ3RP 내부의 기본 일반 목적 스케줄러의 성능은 동일한 MPI 작업에 최적화된 스케줄러와 비교해 어떻게 되는가?
  • RQ4RADICAL-Pilot의 확장성은 시스템 소프트웨어, 특히 OpenMPI의 ORTE에 의해 어느 정도 제한되는가?
  • RQ5테이탄에서 131,000코어를 초과하여 사용할 경우 ORTE에서 실패율이 증가하는 원인은 무엇인가?

주요 결과

  • RADICAL-Pilot는 약화 확장성 하에서 131,000코어와 4,096개 작업까지 성공적으로 확장되었으며, 성능 및 확장성은 RP의 내부 설계가 아니라 시스템 소프트웨어에 의해 제한됨을 확인하였다.
  • 작업의 시작 빈도는 OpenMPI 런타임 환경(ORTE)의 오버헤드에 의해 지배되며, 이는 대규모에서 주요 성능 저하 요인으로 작용한다.
  • 131,000코어를 초과하여 사용할 경우 ORTE 계층의 실패율이 크게 증가하여, 시스템 수준의 확장성 한계에 도달했음을 시사한다.
  • 동일한 MPI 작업에 최적화된 내부 스케줄러를 최적화함으로써 처리량이 초당 7개 작업에서 70개 작업으로 약 10배 향상되었으며, 이는 일반적인 검색 로직을 제거하고 직접 검색을 구현함으로써 달성되었다.
  • RP의 성능 및 확장성은 이제 더 이상 RP 아키텍처의 제약이 아니라 ORTE의 한계에 의해 제약을 받고 있으며, 향후 향상은 저수준 시스템 소프트웨어 개선에 달려 있음을 시사한다.
  • RADICAL-Pilot는 DOE 및 NSF HPC 시스템에서 1억 코어 시간 이상의 생산 환경에서 사용되었으며, DOE INCITE 및 NSF PRAC를 포함한 주요 수상 프로그램을 지원하고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.