Skip to main content
QUICK REVIEW

[논문 리뷰] A Self-adaptive Auto-scaling Method for Scientific Applications on HPC Environments and Clouds

Kiran Mantripragada, Alécio Pedro Delazari Binotto|arXiv (Cornell University)|2014. 12. 19.
Seismic Imaging and Inversion Techniques참고 문헌 8인용 수 6
한 줄 요약

이 논문은 실행 마감일을 충족하기 위해 런타임 중에 온프레미스 HPC 클러스터에서 클라우드로 워크로드를 동적으로 이관하는 자기적응형 자동 스케일링 방법을 제안한다. 실행 시간을 모니터링하고 완료 예측을 통해 시스템은 자동 스케일링을 통해 클라우드 버스팅을 트리거하며, 자원 변동성과 오버헤드에도 불구하고 마감일 위반을 줄인다.

ABSTRACT

High intensive computation applications can usually take days to months to finish an execution. During this time, it is common to have variations of the available resources when considering that such hardware is usually shared among a plurality of researchers/departments within an organization. On the other hand, High Performance Clusters can take advantage of Cloud Computing bursting techniques for the execution of applications together with the on-premise resources. In order to meet deadlines, high intensive computational applications can use the Cloud to boost their performance when they are data and task parallel. This article presents an ongoing work towards the use of extended resources of an HPC execution platform together with Cloud. We propose an unified view of such heterogeneous environments and a method that monitors, predicts the application execution time, and dynamically shifts part of the domain -- previously running in local HPC hardware -- to be computed on the Cloud, meeting then a specific deadline. The method is exemplified along with a seismic application that, at runtime, adapts itself to move part of the processing to the Cloud (in a movement called bursting) and also auto-scales (the moved part) over cloud nodes. Our preliminary results show that there is an expected overhead for performing this movement and for synchronizing results, but our outcomes demonstrate it is an important feature for meeting deadlines in the case an on-premise cluster is overloaded or cannot provide the capacity needed for a particular project.

연구 동기 및 목표

  • 온프레미스 자원 과부하 또는 한계로 인한 과학적 HPC 응용 프로그램의 마감일 위반 문제를 해결한다.
  • 실행 시간 예측이 마감일을 초과할 경우 온프레미스 클러스터에서 클라우드로의 워크로드 이식을 원활하게 가능하게 한다.
  • 런타임 중에 모니터링, 예측 및 클라우드 버스팅을 트리거하는 자기적응 메커니즘을 도입한다.
  • 과잉 프로비저닝을 방지하고 온디맨드 클라우드 유연성의 이점을 활용하여 자본 지출을 최소화한다.
  • 이질적인 환경—온프레미스 HPC 및 클라우드—간의 통합된 실행 모델을 제공하면서도 동기화 및 로드 밸런싱을 유지한다.

제안 방법

  • 런타임 중에 타임스텝당 실행 시간을 모니터링하여 총 응용 프로그램 완료 시간을 추정한다.
  • 예측 모델링을 사용하여 추정된 실행 시간을 사용자가 제공한 마감일과 비교한다.
  • 예측된 실행 시간이 마감일을 초과할 경우 클라우드 버스팅을 트리거하며, 계산 도메인의 일부를 클라우드로 동적으로 이관한다.
  • 워크로드 수요에 따라 가상 머신을 프로비저닝하고 관리함으로써 클라우드 기반 부분에 대해 자동 스케일링을 적용한다.
  • 협동된 데이터 및 작업 분할을 통해 온프레미스 및 클라우드에서 실행된 부분 간의 동기화를 유지한다.
  • 온프레미스 클러스터와 클라우드 자원의 이질성을 추상화하는 통합된 실행 프레임워크를 구현한다.

실험 결과

연구 질문

  • RQ1어떻게 과학적 응용 프로그램이 하이브리드 HPC-클라우드 환경에서 엄격한 마감일을 충족하기 위해 실행을 동적으로 적응시킬 수 있는가?
  • RQ2데이터 병렬 및 작업 병렬 워크로드에서 런타임 예측의 정확도를 높이기 위한 메커니즘은 무엇인가?
  • RQ3수동 조작 없이 자동으로 효율적으로 클라우드 버스팅을 트리거할 수 있는 방법은 무엇인가?
  • RQ4하이브리드 HPC-클라우드 환경에서 자동 스케일링을 통한 동적 워크로드 이식의 성능 및 비용 트레이드오���은 어떠한가?
  • RQ5시스템은 온프레미스 및 클라우드에서 실행된 구성 요소 간의 동기화 및 로드 밸런싱을 어떻게 처리하는가?

주요 결과

  • 제안된 방법은 온프레미스 실행 예측이 마감일을 위반할 경우에 동적으로 클라우드 버스팅을 성공적으로 수행함을 보여준다.
  • 초기 결과에서는 데이터 이동 및 동기화로 인한 예상 오버헤드가 존재하지만, 마감일을 준수하는 데서 유래하는 이점이 비용을 초월함을 확인하였다.
  • 이 방법은 많은 계산 집약적인 과학적 응용 프로그램의 특성을 반영한 지진 시뮬레이션 사용 사례에서 실현 가능성을 입증하였다.
  • 미래의 작업으로는 이종 노드 스케줄링을 목표로 하며, CPU 및 GPU 노드를 모두 지원하는 하이브리드 실행을 지원한다.
  • 온디맨드 클라우드의 유연성을 활용함으로써 고비용의 온프레미스 하드웨어 업그레이드가 필요로 하는 것을 줄였다.
  • 동적으로 변경되는 마감일에 대응 가능하며, 노드 장애나 동시성 변화와 같은 런타임 자원 변동성에도 반응할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.