Skip to main content
QUICK REVIEW

[논문 리뷰] VELOC: VEry Low Overhead Checkpointing in the Age of Exascale

Bogdan Nicolae, Adam Moody|arXiv (Cornell University)|2021. 03. 03.
Power Line Communications and Noise참고 문헌 5인용 수 11
한 줄 요약

VELOC는 I/O 오버헤드를 최소화하고 복구 능력을 향상시키기 위해 엑사스케일 HPC 워크로드를 대상으로 한 프로덕션 준비 완료된 다중 수준 비동기 체크포인팅 시스템이다. 사용자 API가 단순하며, 버스트 버퍼와 로컬 메모리 포함 이종 스토리지 인프라를 투명하게 활용하고, 최소한의 런타임 간섭으로 배경에서 체크포인팅을 수행하여, Summit에서 최대 224 TB/s의 I/O 스루풋을 달성한다.

ABSTRACT

Checkpointing large amounts of related data concurrently to stable storage is a common I/O pattern of many HPC applications. However, such a pattern frequently leads to I/O bottlenecks that lead to poor scalability and performance. As modern HPC infrastructures continue to evolve, there is a growing gap between compute capacity vs. I/O capabilities. Furthermore, the storage hierarchy is becoming increasingly heterogeneous: in addition to parallel file systems, it comprises burst buffers, key-value stores, deep memory hierarchies at node level, etc. In this context, state of art is insufficient to deal with the diversity of vendor APIs, performance and persistency characteristics. This extended abstract presents an overview of VeloC (Very Low Overhead Checkpointing System), a checkpointing runtime specifically design to address these challenges for the next generation Exascale HPC applications and systems. VeloC offers a simple API at user level, while employing an advanced multi-level resilience strategy that transparently optimizes the performance and scalability of checkpointing by leveraging heterogeneous storage.

연구 동기 및 목표

  • 계산 능력이 I/O 대역폭을 뛰어넘는 엑사스케일 HPC 시스템에서 증가하는 I/O 병목 문제를 해결한다.
  • 단일 외부 스토리지에 의존하는 전통적 체크포인팅의 한계를 극복하여 I/O 경쟁과 낮은 확장성 문제를 해결한다.
  • 버스트 버퍼, 키-밸류 스토리지, 병렬 파일 시스템을 포함한 다양한 스토리지 스택에서 작동하는 이식 가능하고 확장성 있고 고성능의 체크포인팅 솔루션을 제공한다.
  • 빈도가 높은 자원 사용과 스토리지 수준 간 데이터 이동 최적화를 통해 배경 체크포인팅으로 인한 런타임 간섭을 최소화한다.
  • 딥러닝 및 데이터 집약적 과학 계산 워크로드와 같은 신규 HPC 워크로드를 위한 효율적이고 저오버헤드 체크포인팅을 가능하게 한다.

제안 방법

  • 응용 프로그램이 중요한 메모리 영역을 선언할 수 있도록 단순한 집합적 API를 제공하며, 선언과 체크포인팅 시작을 분리한다.
  • 노드 로컬 스토리지(예: DRAM, NVRAM)를 고속 중간 계층으로 사용하는 투명한 다중 수준 체크포인팅 전략을 구현한다.
  • 외부 스토리지(Lustre, DAOS 등)로의 비동기 배경 플러시를 통해 차단과 I/O 경쟁을 줄인다.
  • 메모리 레이아웃과 액세스 패턴을 기반으로 한 지능적인 데이터 이동 및 직렬화 최적화를 적용하여 I/O 부하를 감소시키고 효율성을 향상시킨다.
  • DAOS와 같은 고급 스토리지 시스템과 최적화된 키-밸류 API를 통합하여 확장성 있고 저지연 체크포인팅을 지원한다.
  • DeepClone 및 데이터 상태 기법을 활용하여 딥러닝 워크로드를 위한 0복사 모델 복제와 라인재이너스 기반 체크포인팅 탐색을 가능하게 한다.

실험 결과

연구 질문

  • RQ1고성능 컴퓨팅 비율이 높은 엑사스케일 시스템에서 체크포인팅 오버헤드를 어떻게 최소화할 수 있는가?
  • RQ2로컬 메모리, 버스트 버퍼, 병렬 파일 시스템과 같은 이종 스토리지 계층을 최적의 전략으로 활용하여 체크포인팅 성능과 복구 능력을 향상시킬 수 있는가?
  • RQ3배경 체크포인팅을 어떻게 스케줄링하여 런타임 간섭을 최소화하면서도 저지연을 유지할 수 있는가?
  • RQ4다양한 스토리지 API와 하드웨어 특성에 걸쳐 HPC 플랫폼에서 복잡성을 추상화하는 단일 이식 가능한 API를 설계할 수 있는가?
  • RQ5빈번하고 세밀한 모델 스냅샷이 필요한 딥러닝 워크로드를 위한 체크포인팅을 어떻게 효율적으로 확장할 수 있는가?

주요 결과

  • VELOC는 Summit에서 로컬 메모리 체크포인팅 시 최대 224 TB/s의 I/O 스루풋을 달성하여 뛰어난 확장성을 입증했다.
  • 전용 응용 프로그램 실행 중에도 배경에서 로컬 체크포인트를 Lustre로 플러시할 때 심각한 런타임 오버헤드가 발생하지 않았다.
  • 노드 로컬 스토리지를 고속 중간 계층으로 사용함으로써, 고비용 외부 I/O 작업의 빈도를 감소시켜 전체 I/O 효율성을 향상시켰다.
  • 최적화된 키-밸류 API를 통한 DAOS 통합은 시스템의 차세대 확장 가능한 스토리지 시스템으로의 확장성을 입증했다.
  • VELOC는 Summit, Sierra, Fugaku와 같은 프리-엑사스케일 시스템에서 HACC, LatticeQCD, EXAALT 등의 프로덕션 HPC 응용 프로그램을 성공적으로 지원했다.
  • DeepClone 및 데이터 상태 기법을 통해 딥러닝 모델의 효율적이고 0복사 복제가 가능해져 체크포인팅 지연을 줄이고 라인재이너스 기반 모델 관리가 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.