Skip to main content
QUICK REVIEW

[논문 리뷰] Enabling Loosely-Coupled Serial Job Execution on the IBM BlueGene/P Supercomputer and the SiCortex SC5832

Ioan Raicu, Zhao Zhang|ArXiv.org|2008. 08. 26.
Distributed and Parallel Computing Systems참고 문헌 25인용 수 3
한 줄 요약

이 논문은 응용 프로그램을 수정하지 않고도 IBM BlueGene/P 및 SiCortex SC5832와 같은 대규모 슈퍼컴퓨터에서 느슨하게 결합된 순차적 작업을 효율적으로 실행할 수 있는 프레임워크를 제안한다. 입출력(I/O) 및 작업 스케줄링 최적화를 통해, BlueGene/P에서 최대 4096개의 프로세서, SiCortex에서 5832개의 프로세서까지 높은 확장성을 달성하였으며, 초당 수천 건의 작업을 지속적으로 실행하는 데 성공하여 에너지 모델링 및 분자역학과 같은 다양한 분야에서 효과를 입증하였다.

ABSTRACT

Our work addresses the enabling of the execution of highly parallel computations composed of loosely coupled serial jobs with no modifications to the respective applications, on large-scale systems. This approach allows new-and potentially far larger-classes of application to leverage systems such as the IBM Blue Gene/P supercomputer and similar emerging petascale architectures. We present here the challenges of I/O performance encountered in making this model practical, and show results using both micro-benchmarks and real applications on two large-scale systems, the BG/P and the SiCortex SC5832. Our preliminary benchmarks show that we can scale to 4096 processors on the Blue Gene/P and 5832 processors on the SiCortex with high efficiency, and can achieve thousands of tasks/sec sustained execution rates for parallel workloads of ordinary serial applications. We measured applications from two domains, economic energy modeling and molecular dynamics.

연구 동기 및 목표

  • 페타스케일 슈퍼컴퓨터에서 대규모 수의 독립적인 순차적 작업을 효율적으로 실행하는 데 도전 과제를 해결한다.
  • 느슨하게 결합된 작업 실행 모델에서 확장성에 장애가 되는 입출력(I/O) 성능 저하 문제를 극복한다.
  • 기존의 순차적 응용 프로그램을 수정 없이 대규모 시스템에서 효율적으로 실행할 수 있도록 한다.
  • IBM BlueGene/P 및 SiCortex SC5832와 같은 두 가지 서로 다른 페타스케일 아키텍처에서 높은 확장성과 성능을 입증한다.
  • 경제적 에너지 모델링 및 분자역학과 같은 다양한 분야의 실제 응용 프로그램을 활용해 접근 방식을 검증한다.

제안 방법

  • 수천 개의 프로세서를 통해 독립적인 순차적 작업을 스케줄링하고 관리하는 런타임 시스템을 설계한다.
  • 대규모 작업 실행에서의 경쟁을 줄이고 처리량을 향상시키기 위해 최적화된 입출력(I/O) 전략을 구현한다.
  • 작업 생성 및 조율의 오버헤드를 최소화하기 위해 경량 프로세스 관리 및 작업 디스패칭을 사용한다.
  • 저지연 시간 인터커넥트와 고밀도 컴퓨팅 노드를 활용해 효율적인 작업 분배를 실현한다.
  • 기존의 작업 관리 시스템과 통합하여 생산용 슈퍼컴퓨터에서의 호환성과 원활한 배포를 보장한다.
  • 장기간 실행되는 워크로드에서 고도의 활용도와 신뢰성을 유지하기 위해 로드 밸런싱 및 장애 내성 메커니즘을 적용한다.

실험 결과

연구 질문

  • RQ1페타스케일 시스템인 BlueGene/P 및 SiCortex SC5832에서 느슨하게 결합된 순차적 작업을 어떻게 효율적으로 스케줄링하고 실행할 수 있는가?
  • RQ2대규모 작업 실행에서 발생하는 입출력(I/O) 성능 저하의 주요 원인은 무엇이며, 이를 어떻게 완화할 수 있는가?
  • RQ3기존의 순차적 응용 프로그램이 현대 슈퍼컴퓨터에서 수정 없이 얼마나 큰 규모로 실행될 수 있는가?
  • RQ4제안된 방법을 사용할 경우 이 아키텍처에서 도달 가능한 최대 작업 처리량과 확장성은 어느 정도인가?
  • RQ5분자역학 및 에너지 모델링과 같은 다양한 응용 분야에서 이 프레임워크의 성능은 어떻게 변할 수 있는가?

주요 결과

  • 시스템은 IBM BlueGene/P 및 SiCortex SC5832 양쪽 모두에서 초당 수천 건의 작업을 지속적으로 실행하는 데 성공하였다.
  • BlueGene/P에서 최대 4096개의 프로세서, SiCortex에서 최대 5832개의 프로세서까지 높은 효율성으로 확장성이 입증되었다.
  • 입출력(I/O) 최적화가 성능 저하 요인을 크게 감소시켜 대규모에서 고처리량 작업 실행을 가능케 하였다.
  • 경제적 에너지 모델링 및 분자역학 분야의 실제 응용 프로그램들이 높은 성능과 확장성을 보였다.
  • 수정되지 않은 순차적 응용 프로그램이 대규모 시스템에서 실행 가능하게 되어, 활용 가능한 워크로드의 범위가 확장되었다.
  • 마이크로 벤치마크와 생산용 응용 프로그램을 통해 프레임워크가 높은 병렬 효율성을 달성하는 데 효과적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.