[논문 리뷰] HPC Cloud for Scientific and Business Applications: Taxonomy, Vision, and Research Challenges
이 논문은 과학적 및 비즈니스 워크로드에서의 역할을 분석하면서 고성능 컴퓨팅(HPC) 클라우드를 위한 종합적인 분류 체계, 비전 및 연구 의제를 제시한다. 성능 격리, 자원 할당, 가격 모델, 하이브리드 클라우드 통합과 같은 핵심 과제를 규명하며, HPC 워크로드를 클라우드 환경에서 구현할 수 있도록 적응형 자원 관리 및 지속 가능한 가격 모델을 주장한다.
High Performance Computing (HPC) clouds are becoming an alternative to on-premise clusters for executing scientific applications and business analytics services. Most research efforts in HPC cloud aim to understand the cost-benefit of moving resource-intensive applications from on-premise environments to public cloud platforms. Industry trends show hybrid environments are the natural path to get the best of the on-premise and cloud resources---steady (and sensitive) workloads can run on on-premise resources and peak demand can leverage remote resources in a pay-as-you-go manner. Nevertheless, there are plenty of questions to be answered in HPC cloud, which range from how to extract the best performance of an unknown underlying platform to what services are essential to make its usage easier. Moreover, the discussion on the right pricing and contractual models to fit small and large users is relevant for the sustainability of HPC clouds. This paper brings a survey and taxonomy of efforts in HPC cloud and a vision on what we believe is ahead of us, including a set of research challenges that, once tackled, can help advance businesses and scientific discoveries. This becomes particularly relevant due to the fast increasing wave of new HPC applications coming from big data and artificial intelligence.
연구 동기 및 목표
- 과학적 및 비즈니스 컴퓨팅 환경에서 HPC 클라우드 도입 현황을 분석하기 위해.
- 클라우드 기반 HPC에서의 성능 격리, 자원 할당 및 서비스 품질 보장과 관련된 핵심 연구 과제를 규명하기 위해.
- 다양한 사용자 규모를 고려한 진화하는 가격 및 계약 모델을 통해 HPC 클라우드의 지속 가능성 분석하기 위해.
- 비용과 성능 최적화를 위해 온프레미스 및 클라우드 워크로드를 균형 잡는 데에 하이브리드 클라우드 아키텍처의 역할 탐색하기 위해.
- 컨테이너, 프로그래머블 논리 장치(FPGA), GPU 및 저지연 네트워크와 같은 신기술이 HPC 클라우드의 타당성에 미치는 영향 평가하기 위해.
제안 방법
- 배포 모델 기반 HPC 클라우드의 분류 체계 수립: '클라우드 내 HPC', 'HPC + 클라우드', 'HPC as a Service'로 분류.
- MPI 기반 및 명백하게 병렬화 가능한 워크로드를 포함한 실제 응용 프로그램과 HPC 벤치마크를 사용하여 성능 및 비용의 상충 관계 분석.
- 공용 클라우드에서 자원 공유 및 가상화가 응용 프로그램 성능 변동성에 미치는 영향 평가.
- 온프레미스 및 클라우드 자원을 통합하는 하이브리드, 확장 가능하고 프로그래머블 플랫폼으로서의 HPC 클라우드 비전 제시.
- 컨테이너, FPGA, GPU 및 저지연 네트워크(예: Azure, ProfitBricks)와 같은 신기술이 HPC 클라우드의 실현 가능성을 높이는 데 기여하는지 분석.
- 소규모 및 대규모 사용자 모두를 대상으로 하는 적응형 자원 할당, SLA 인식 스케줄링 및 비용 최적화 프로비저닝에 대한 연구 필요성 규명.
실험 결과
연구 질문
- RQ1공용 클라우드 환경에서 자원이 공유되고 InfiniBand가 아닌 네트워크를 사용할 경우, 고상호작용 프로세서 통신을 요구하는 HPC 응용 프로그램이 수용 가능한 성능을 달성할 수 있는 방법은 무엇인가?
- RQ2비용과 성능 최적화를 위해 온프레미스 자원과 클라우드 자원을 균형 있게 조합하는 데 가장 효과적인 하이브리드 클라우드 전략은 무엇인가?
- RQ3HPC 클라우드에서 소규모 사용자와 기업 사용자 모두를 수용할 수 있는 지속 가능하고 융통성 있는 가격 모델을 설계하는 방법은 무엇인가?
- RQ4GPU, FPGA 및 저지연 네트워킹과 같은 신기술이 온프레미스 클러스터와 클라우드 플랫폼 간의 성능 격차를 줄이는 데 어떤 역할을 하는가?
- RQ5기존에 '무료'로 제공되던 HPC 환경에서 사용자 행동 변화에 따라 클라우드 사용의 금전적 책임이 부각됨에 따라 자원 관리 시스템은 어떻게 사용자 행동 변화에 적응할 수 있는가?
주요 결과
- 명백하게 병렬화 가능한 응용 프로그램은 현재의 클라우드 인프라에서 양호한 성능을 달성하지만, 고통신량을 요구하는 고밀도 결합 HPC 워크로드는 네트워크 지연으로 인해 확장성에 한계를 가진다.
- 공용 클라우드에서의 자원 공유는 동일한 자원 할당 조건에서도 반복 실행 간 성능 변동성을 유발한다.
- 온프레미스 클러스터와 클라우드 버스팅을 조합한 하이브리드 클라우드 모델은 변동성이 큰 워크로드를 가진 조직에게 지속 가능하고 비용 효율적인 길을 제시한다.
- 사용량 기반 청구 모델로의 전환은 전통적인 HPC 클러스터에서 비용 시각화가 없는 환경과 비교해 자원 과다 할당을 줄이는 사용자 행동 변화를 유도할 수 있다.
- GPU, FPGA 및 저지연 네트워크(예: Azure, ProfitBricks)와 같은 신기술은 온프레미스와 클라우드 HPC 플랫폼 간의 성능 격차를 크게 줄일 것으로 기대된다.
- 지속 가능한 HPC 클라우드 도입은 기술적 진보 외에도 적응형 가격 모델 및 SLA 기반 자원 할당 메커니즘에 대한 연구 필요성이 수반된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.