Skip to main content
QUICK REVIEW

[논문 리뷰] Design and Operation of Shared Machine Learning Clusters on Campus

Kaiqiang Xu, Decang Sun|arXiv (Cornell University)|2021. 10. 04.
Cloud Computing and Resource Management참고 문헌 13인용 수 16
한 줄 요약

TACC는 4단계 워크플로우 추상화—스키마, 컴파일러, 스케줄링, 실행—를 통해 대규모 머신러닝 워크로드의 효율적이고 확장 가능하며 재현 가능한 실행을 가능하게 하는 포괄적인 클라우드 인프라이다. 이는 최소한의 코드 변경으로 시스템 최적화를 동적으로 통합할 수 있게 하여, 분산 DNN 학습, 최적화된 네트워킹, 전용 하드웨어에 대한 원활한 지원을 통해 배포를 단순화하고 ML 학습을 가속화한다.

ABSTRACT

Amid the rapid advancements in large machine learning (ML) models, universities worldwide are investing substantial funds and efforts into GPU clusters. However, managing a shared GPU cluster poses a pyramid of challenges, from hardware configuration to resource allocation among users. This paper introduces SING, a full-stack solution designed to streamline the management of shared GPU clusters in academic institutions. Motivated by the pressing need for efficient resource sharing and the challenges posed by limited staffing, we present a comprehensive view of SING's architecture and design choices, which achieves operational efficiency (i.e., low maintenance cost and high resource utilization). We also share experience and insights from the real-world operations of SING, including analysis of its usage patterns and management of incidents and failures. This paper is part of our ongoing effort to improve the management of shared ML clusters. We open-source relevant resources to facilitate the development and operation of similar clusters for ML.

연구 동기 및 목표

  • 일반적인 클라우드 플랫폼과 전문화된 ML 시스템 간의 격차를 해소하기 위해, 둘의 강점을 하나의 인프라에서 통합한다.
  • 공동 사용 클러스터에서 다양한 ML 워크로드의 효율적이고 동적이며 재현 가능한 실행을 가능하게 한다.
  • 최신 ML 시스템 연구 성과(예: 통신 스케줄링, 하드웨어 가속화 등)를 생산 환경에 간편하게 통합할 수 있도록 한다.
  • 세분화된 자원 할당과 플랫폼 간 이식성을 갖춘 다중 테넌트, 온디맨드 작업 제출을 지원한다.
  • SSH 접근이 가능한 어떤 시스템에서나 작업 제출, 모니터링, 디버깅이 가능한 경량 CLI 도구(tcloud)를 통해 ML 연구자들에게 서버리스와 유사한 경험을 제공한다.

제안 방법

  • 최적화 기법을 단일 실행 시스템에서 분리하기 위해, 작업 스키마, 컴파일러, 스케줄링, 실행 4단계 워크플로우로 ML 작업 실행을 추상화한다.
  • 재현 가능성을 확보하기 위해 계산, 네트워크, QoS, 코드, 종속성, 런타임 설정을 모두 포함하는 자가 포함된 통합 작업 스키마를 정의한다.
  • 컴파일러 레이어를 활용해 작업 기술서를 분석하고 런타임 환경을 준비하며, 정적 특성(예: 언어, 작업 크기)에 기반해 최적화된 실행 계획을 생성한다.
  • 실시간 요소(예: 작업 연령, 크기, 예상 실행 시간, 네트워크 토폴로지)를 기반으로 최적의 런타임 시스템을 선택하는 동적 스케줄링 레이어를 구현한다.
  • RDMA 연결된 GPU, 공유 파일 시스템, 스마트 NIC 등 이종 백엔드에서 실패에 대비한 전환 및 런타임 선택 기능을 통해 실행을 가능하게 한다.
  • 기존 시스템 최적화(예: BytePS, FlexFlow, Tiara)와 투명하게 통합되어 사용자가 코드 변경 없이 또는 최소한의 변경으로 고급 최적화(예: 파라미터 서버 튜닝, RDMA, 네트워크 내 계산)를 활용할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1다양한 이종 ML 워크로드에 대해 통신 스케줄링, 하드웨어 가속화 등 다양한 시스템 최적화를 동적으로 조합하고 적용할 수 있는 포괄적 ML 인프라는 어떻게 설계할 수 있는가?
  • RQ2어떤 추상화 레이어 설계가 신규 ML 시스템 연구 성과를 생산 클러스터에 최소한의 엔지니어링 오버헤드로 원활하게 통합할 수 있는가?
  • RQ3공동 사용 캠퍼스 ML 클러스터는 세분화된 자원 할당과 재현 가능성을 확보하면서도 온디맨드, 다중 테넌트 작업 실행을 어떻게 지원할 수 있는가?
  • RQ4이종 하드웨어와 운영 체제 간에 효율적이고 확장 가능하며 이식 가능한 작업 관리를 위한 메커니즘은 무엇인가?
  • RQ5성능나 비용을 포기하지 않고도 전문화된 ML 시스템과 일반적인 클라우드 플랫폼의 목표를 통합할 수 있는 클라우드 인프라는 어떻게 설계할 수 있는가?

주요 결과

  • TACC의 4단계 추상화는 다양한 ML 워크로드에 걸쳐 최적화 기법을 동적으로 조합하여 적용할 수 있게 하여 적응성과 성능을 향상시킨다.
  • tcloud CLI 도구는 플랫폼 간 호환성을 갖춘 서버리스와 유사한 경험을 제공하며, SSH 접근이 가능한 어떤 시스템에서나 작업 제출과 분산 디버깅을 가능하게 한다.
  • TACC는 모든 실행 매개변수를 봉인한 자가 포함된 작업 스키마를 통해 재현 가능한 작업 실행을 지원하여, 다양한 인스턴스 간 일관된 동작을 보장한다.
  • 사용자가 파라미터 서버 튜닝, RDMA, 네트워크 내 계산과 같은 고급 최적화를 활용하기 위해 최소한의 코드 수정 또는 수정 없이도 가능하게 한다.
  • TACC의 스케줄링 레이어는 예상 실행 시간과 네트워크 토폴로지 등을 포함한 실시간 작업 및 시스템 특성에 기반해 기반 런타임 시스템을 적응적으로 선택할 수 있다.
  • TACC는 기존 시스템 수준 최적화(FlexFlow, BytePS, Tiara 등)를 통합된 확장 가능한 플랫폼으로 통합하여 연구자들이 배포 시 부담을 줄일 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.