Skip to main content
QUICK REVIEW

[논문 리뷰] Cloud Services Enable Efficient AI-Guided Simulation Workflows across Heterogeneous Resources

Logan Ward, J. Gregory Pauloski|arXiv (Cornell University)|2023. 03. 15.
Scientific Computing and Data ManagementDecision Sciences참고 문헌 45인용 수 3
한 줄 요약

이 논문은 FuncX와 Globus를 활용한 클라우드 네이티브, FaaS 기반 워크플로우 프레임워크를 제시하여 이질적인 HPC 및 GPU 자원 간에 효율적이고 안전하며 이식 가능한 AI 지도형 시뮬레이션 워크플로우를 가능하게 한다. 참조 기반 데이터 전송과 사용자 설정 가능 조정을 활용함으로써 기존의 직접 연결 워크플로우와 동일한 과학적 성능을 달성하면서도 배포를 단순화하고 운영 복잡성을 감소시킨다.

ABSTRACT

Applications that fuse machine learning and simulation can benefit from the use of multiple computing resources, with, for example, simulation codes running on highly parallel supercomputers and AI training and inference tasks on specialized accelerators. Here, we present our experiences deploying two AI-guided simulation workflows across such heterogeneous systems. A unique aspect of our approach is our use of cloud-hosted management services to manage challenging aspects of cross-resource authentication and authorization, function-as-a-service (FaaS) function invocation, and data transfer. We show that these methods can achieve performance parity with systems that rely on direct connection between resources. We achieve parity by integrating the FaaS system and data transfer capabilities with a system that passes data by reference among managers and workers, and a user-configurable steering algorithm to hide data transfer latencies. We anticipate that this ease of use can enable routine use of heterogeneous resources in computational science.

연구 동기 및 목표

  • 이질적인 컴퓨팅 자원 간에 효율적이고 안전하며 이식 가능한 AI 지도형 시뮬레이션 워크플로우를 실행하는 데 증가하는 수요를 해결하기 위해.
  • 다중 자원 과학 워크플로우에서의 배포 복잡성과 단일 장애 지점 제거를 위해.
  • 지능적인 조정과 효율적인 데이터 이동을 통해 AI 및 시뮬레이션 워크로드에서의 데이터 전송 지연과 오버헤드를 최소화하기 위해.
  • 클라우드 기반 관리 서비스가 기존의 직접 연결 워크플로우 시스템과 동등한 성능을 달성할 수 있음을 입증하기 위해.
  • 안전하고 확장 가능하며 신뢰할 수 있는 다중 자원 오케스트레이션을 단순화하여 계산 과학 분야에서 이종 컴퓨팅의 광범위한 도입을 가능하게 하기 위해.

제안 방법

  • HPC 및 GPU 자원 간의 직접 자원 연결 없이도 원격 작업 실행을 관리하기 위해 연합형 Function-as-a-Service (FaaS) 플랫폼 (FuncX)을 사용한다.
  • ProxyStore를 사용하여 참조 기반으로 P2P, Globus 기반 데이터 전송을 가능하게 하여 중앙 제어자에서의 데이터 이동을 최소화한다.
  • Colmena를 통합하여 사용자 설정 가능한 조정 정책을 표현함으로써 계산과 I/O를 겹치게 하여 데이터 전송 지연을 숨긴다.
  • 제어자 부하를 줄이고 대규모 데이터 집약적 워크플로우에서의 버티브를 방지하기 위해 작업 지시사항과 데이터를 참조로 전달한다.
  • 인증, 권한 부여 및 오류 처리를 위한 클라우드 호스팅된 조율 서비스를 활용하여 신뢰성을 향상시키고 배포 복잡성을 감소시킨다.
  • 합성 워크로드와 두 가지 실제 응용 프로그램(분자 설계 및 서rogate 모델 훈련)을 사용하여 성능을 벤치마킹한다.

실험 결과

연구 질문

  • RQ1클라우드 호스팅된 FaaS 및 데이터 전송 서비스가 AI 지도형 시뮬레이션 워크로드에서 기존의 직접 연결 워크플로우 시스템과 동등한 성능을 달성할 수 있는가?
  • RQ2참조 기반 전송과 지능적인 조정이 다중 자원 과학 워크플로우에서 종단 간 지연을 얼마나 효과적으로 줄이는가?
  • RQ3데이터 크기와 전송 메커니즘(예: Redis 대비 Globus)이 작업 오버헤드와 워크플로우 성능에 미치는 영향은 어떠한가?
  • RQ4클라우드 기반 관리 서비스가 이종의 다중 사이트 과학 계산 환경에서 배포를 얼마나 단순화하고 신뢰성을 향상시킬 수 있는가?
  • RQ5FaaS, 참조 기반 데이터 전달, 동적 조정의 통합이 과학적 정확도를 희생시키지 않으면서도 확장 가능하고 안전하며 이식 가능한 AI-시뮬레이션 워크플로우를 가능하게 할 수 있는가?

주요 결과

  • 클라우드 기반 관리 워크플로우(FuncX + Globus)를 사용해 생성한 서rogate 모델의 RMSD는 1.30 ± 0.08 eV/Å로, 기존의 Parsl 기반 접근 방식(1.47 ± 0.09 eV/Å)과 유사하여 과학적 성능 동등성을 입증하였다.
  • GPU 작업의 경우, 작업 오버헤드는 주로 Globus 데이터 전송 시간에 의해 지배되며, 평균적으로 각 방향당 약 2초였다. 이는 합성 벤치마킹 결과와 일치하였다.
  • CPU 작업의 경우, FuncX 오버헤드는 주로 제어자로의 알림 지연에 기인했고, Parsl의 오버헤드는 데이터 크기에 따라 증가하였다—3MB 메시지에 대해 820ms, 20kB 메시지에 대해 20ms였다.
  • 참조 기반 전달은 더 큰 메시지에서 데이터 전송 오버헤드를 크게 줄였으며, Parsl에서 참조 전달을 사용할 경우 샘플링 시 200ms, 시뮬레이션 시 170ms로 일관된 전송 시간을 기록하였다.
  • 참조 기반 전달과 지능적인 조정을 통해 단순한 데이터 전송 방식 대비 응용 프로그램 지연을 최대 10배까지 감소시킬 수 있었다.
  • 10kB를 초과하는 데이터의 경우, 직접 Globus 또는 Redis를 통한 전송(가능한 한)이 제어자 중계를 통한 전달보다 효율적이었으며, 직접 터널이 가능한 경우 Redis가 더 빠르게 작동하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.