Skip to main content
QUICK REVIEW

[논문 리뷰] Scylla: A Mesos Framework for Container Based MPI Jobs

Pankaj Saha, Angel Beltre|arXiv (Cornell University)|2019. 01. 01.
Cloud Computing and Resource Management참고 문헌 10인용 수 10
한 줄 요약

Scylla는 클라우드 기반 HPC 클러스터에서 컨테이너화된 MPI 작업을 효율적으로 오케스트레이션할 수 있도록 Apache Mesos와 Docker Swarm을 통합하는 Mesos 프레임워크입니다. CPU, 메모리, 네트워크 요구사항 기반 정책 기반 스케줄링을 활용하여 VM 간에 컨테이너를 공유 스케줄링함으로써 자원 경쟁과 네트워크 오버헤드를 최소화하여 CPU/메모리 집약적 및 네트워크 집약적 MPI 워크로드 모두의 성능을 향상시킵니다.

ABSTRACT

Open source cloud technologies provide a wide range of support forcreating customized compute node clusters to schedule tasks andmanaging resources. In cloud infrastructures such asJetstream and Chameleon, which are used for scientific research, usersreceive complete control of the Virtual Machines (VM) that are allocated tothem. Importantly, users get root access to the VMs. This provides anopportunity for HPC users to experiment with new resource managementtechnologies such as Apache Mesos that have proven scalability,flexibility, and fault tolerance. To ease the development anddeployment of HPC tools on the cloud, the containerization technologyhas matured and is gaining interest in the scientific community. Inparticular, several well known scientific code bases now have publiclyavailable Docker containers. While Mesos provides support for Dockercontainers to execute individually, it does not provide support forcontainer inter-communication or orchestration of the containers for aparallel or distributed application. In this paper, we present thedesign, implementation, and performance analysis of a Mesos framework,{\it Scylla}, which integrates Mesos with Docker Swarm to enableorchestration of MPI jobs on a cluster of VMs acquired from theChameleon cloud\cite{ChameleonCloud}. Scylla uses Docker Swarm for communication betweencontainerized tasks (MPI processes) and Apache Mesos for resourcepooling and allocation. Scylla allows a policy driven approach todetermine how the containers should be distributed across the nodesdepending on the CPU, memory, and network throughput requirement foreach application.

연구 동기 및 목표

  • 과학적 워크로드를 위한 Apache Mesos에서의 네이티브 MPI 및 인터 컨테이너 통신 지원 부족 문제를 해결하기 위해.
  • Chameleon과 같은 클라우드 환경에서 VM 간에 도커라이즈된 MPI 프로세스의 효율적 공스케줄링 및 분포를 가능하게 하기 위해.
  • 응용 프로그램 특화 자원 요구사항(CPU, 메모리, 네트워크) 기반으로 컨테이너 배치를 최적화하는 정책 기반 접근법을 제공하기 위해.
  • Mesos의 자원 풀링과 Docker Swarm의 컨테이너 네트워킹 및 오케스트레이션을 조합하여 자원 활용도와 응용 프로그램 처리량을 향상시키기 위해.
  • 다양한 스케줄링 정책과 워크로드 하에서 컨테이너화된 MPI 작업의 성능을 평가하기 위해.

제안 방법

  • Scylla는 VM 간 자원 할당 및 스케줄링을 위해 Mesos를 사용하는 Mesos 프레임워크로 구현됩니다.
  • MPI 프로세스의 컨테이너 네트워킹 및 상호 프로세스 통신을 관리하기 위해 Docker Swarm을 기반 오케스트레이터로 활용합니다.
  • CPU, 메모리, 네트워크 요구사항을 분석하여 노드 간 최적의 컨테이너 배치를 결정하는 정책 기반 스케줄러를 사용합니다.
  • Mesos의 자원 오퍼는 주로 주도 자원 공정성(Dominant Resource Fairness, DRF)을 사용하여 협상되며, Docker Swarm은 컨테이너 라이프사이클 및 오버레이 네트워킹을 담당합니다.
  • 노드 간 통신 오버헤드를 줄이기 위해 동일한 노드에 여러 컨테이너를 공스케줄링하는 것을 지원합니다.
  • 사용자가 VM에 root 액세스 권한을 갖고 있으며 커스텀 자원 관리 스택을 배포할 수 있는 클라우드 인fra구조인 Chameleon과 통합됩니다.

실험 결과

연구 질문

  • RQ1클라우드 네이티브 자원 관리자인 Apache Mesos를 사용하여 컨테이너 기반 환경에서 MPI 워크로드를 어떻게 효율적으로 오케스트레이션할 수 있는가?
  • RQ2분산된 MPI 작업에서 인터 컨테이너 통신과 자원 경쟁으로 인한 성능 저하를 최소화하는 스케줄링 정책은 무엇인가?
  • RQ3Docker Swarm과 Mesos의 통합이 CPU 집약적, 메모리 집약적, 네트워크 집약적 MPI 응용 프로그램의 성능에 어떤 영향을 미치는가?
  • RQ4정책 기반 컨테이너 배치가 클라우드 기반 HPC 클러스터에서 자원 활용도와 응용 프로그램 처리량을 얼마나 향상시키는가?
  • RQ5동일한 노드에 컨테이너를 공치소치하는 것과 여러 노드에 분산 배치하는 것 사이의 성능 트레이드오프는 무엇인가?

주요 결과

  • Scylla는 Mesos를 자원 관리자로, Docker Swarm을 인터 컨테이너 네트워킹 수단으로 조합하여 컨테이너화된 MPI 작업의 엔드 투 엔드 오케스트레이션을 성공적으로 구현했습니다.
  • 정책 기반 스케줄링은 응용 프로그램 특성에 따라 컨테이너를 배치함으로써 성능을 크게 향상시켰습니다. 네트워크 집약적 워크로드는 가까이 배치하고, CPU/메모리 집약적 워크로드는 자원 경쟁을 피하기 위해 분산 배치함으로써 성능이 향상되었습니다.
  • 네트워크 집약적 MPI 응용 프로그램의 경우, 동일한 노드에 컨테이너를 공치소치함으로써 통신 오버헤드를 감소시키고 처리량을 향상시켰습니다.
  • CPU 및 메모리 집약적 워크로드의 경우, 컨테이너를 노드 간에 분산 배치함으로써 자원 경쟁을 줄이고, 공치소치 대비 실행 시간을 개선했습니다.
  • Mesos와 Docker Swarm의 통합은 효율적인 공스케줄링을 가능하게 하여 자원 활용도 향상과 유휴 시간 감소를 이끌어냈습니다.
  • 성능 평가 결과, Docker Swarm의 가상 네트워크 통신은 최소한의 오버헤드를 유발하지만, 네트워크 기반 응용 프로그램은 노드 간 통신 지연에 민감한 것으로 나타났습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.