Skip to main content
QUICK REVIEW

[논문 리뷰] Contention-Aware GPU Partitioning and Task-to-Partition Allocation for Real-Time Workloads

Houssam-Eddine Zahaf, Ignacio Sanudo Olmedo|arXiv (Cornell University)|2021. 05. 21.
Parallel Computing and Optimization Techniques참고 문헌 17인용 수 8
한 줄 요약

이 논문은 메모리 집약적이고 계산 집약적인 작업을 각 파티션에 그룹화함으로써 실시간 커널 간 간섭을 줄이는 내용 인지 기반 GPU 파티셔닝 및 작업-파티션 할당 히ュ리스틱을 제안한다. 비파티셔닝된 GPU 실행 방식에 비해 스케줄러블리티와 효율성을 향상시키며, 최대 25개의 파티션(각 파티션에 2개의 작업)을 달성하고, 자원 경쟁 상황에서 실시간 워크로드 스케줄링에서 기준 방법보다 뛰어난 성능을 발휘한다.

ABSTRACT

In order to satisfy timing constraints, modern real-time applications require massively parallel accelerators such as General Purpose Graphic Processing Units (GPGPUs). Generation after generation, the number of computing clusters made available in novel GPU architectures is steadily increasing, hence, investigating suitable scheduling approaches is now mandatory. Such scheduling approaches are related to mapping different and concurrent compute kernels within the GPU computing clusters, hence grouping GPU computing clusters into schedulable partitions. In this paper we propose novel techniques to define GPU partitions; this allows us to define suitable task-to-partition allocation mechanisms in which tasks are GPU compute kernels featuring different timing requirements. Such mechanisms will take into account the interference that GPU kernels experience when running in overlapping time windows. Hence, an effective and simple way to quantify the magnitude of such interference is also presented. We demonstrate the efficiency of the proposed approaches against the classical techniques that considered the GPU as a single, non-partitionable resource.

연구 동기 및 목표

  • 공유 SM과 메모리에서 동시 실행되는 커널 간의 겹침으로 인한 자원 경쟁과 예측 불가능성 문제를 해결한다.
  • 작업 특성에 기반해 GPU 자원을 고립된, 스케줄러블한 단위로 파티셔닝하여 GPU 활용도와 시간 예측 가능성을 향상시킨다.
  • 공동 배치된 커널 간의 간섭을 최소화하는 히ュ리스틱 기반의 작업-파티션 할당 전략을 개발한다.
  • 비파티셔닝된 GPU 실행 및 전통적인 스케줄링 접근 방식에 비해 실시간 시스템에서의 우수성을 입증한다.
  • 실제 구현을 위한 통합을 가능하게 하기 위해 NVIDIA MIG 및 AMD CU 마스킹과 같은 기존 GPU 프레임워크와의 연동을 가능하게 한다.

제안 방법

  • 커널 실행 시간과 자원 요구량에 기반해 스트리밍 멀티프로세서(SMs)를 스케줄러블한 파티션으로 그룹화하는 GPU 파티셔닝 히ュ리스틱을 제안한다.
  • 동시 실행 중인 커널 간의 공유 메모리 및 계산 자원 간의 간섭 정도를 정량화하기 위해 내용 지표(contention metric)를 도입한다.
  • 간섭을 최소화하기 위해 상호보완적인 워크로드를 조합하는 데 목적이 있는 두 가지 작업 할당 히ュ리스틱(Best Fit(BF) 및 Smallest Memory Size(SMS))을 활용한다.
  • 예를 들어 두 개의 메모리 집약적 작업이 같은 파티션에 할당되는 것을 방지하기 위해 충돌하는 커널 쌍을 막는 금지 목록(forbidden pair lists)을 적용한다.
  • 파티셔닝된 실행 환경에서 총 활용도 평가 및 시간 제약 조건을 보장하는 스케줄러블리티 분석 프레임워크를 적용한다.
  • 다양한 작업 수(50개 및 200개)와 활용도 수준을 가진 합성 워크로드를 사용하여 비파티셔닝 기준(1G)과 비교하여 접근 방식을 검증한다.

실험 결과

연구 질문

  • RQ1다양한 실행 시간과 자원 요구량을 가진 실시간 커널 간의 간섭을 최소화하기 위해 GPU 파티션은 어떻게 정의할 수 있는가?
  • RQ2다중 커널 GPU 워크로드에서 자원 활용도와 간섭 감소를 균형 있게 달성하기 위해 가장 적합한 작업-파티션 할당 전략은 무엇인가?
  • RQ3내용 인지 기반 파티셔닝은 비파티셔닝된 GPU 실행에 비해 스케줄러블리티를 얼마나 향상시키는가?
  • RQ4다양한 워크로드와 간섭 조건에서 다양한 히ュ리스틱 전략(BF 대 SMS)은 어떻게 성능을 발휘하는가?
  • RQ5제안된 방법은 NVIDIA MIG나 AMD CU 마스킹과 같은 기존 GPU 가상화 기능과 통합될 수 있는가?

주요 결과

  • 제안된 히ュ리스틱는 모든 테스트 활용도 수준에서 거의 1.0에 가까운 스케줄러블리티율을 달성하며, 고활용도에서 낮은 스케줄러블리티를 보이는 비파티셔닝 기준(1G)에 비해 뚜렷한 우월성을 보였다.
  • 50개의 작업을 스케줄링할 경우 평균 파티션 수는 약 25개로, 약 두 개의 작업이 각 파티션에 할당됨을 의미하며, 이는 간섭 최소화 목표와 부합한다.
  • Best Fit(BF) 히ュ리스틱는 후보 병합 연산이 줄어들어 SMS보다 높은 효율성과 더 빠른 분석 시간을 달성한다.
  • 200개의 작업을 처리할 경우, 평균 파티션당 작업 밀도가 증가(4개 이상)함에 따라 클러스터링 효율성이 떨어지고, 간섭 증가 및 성능 저하가 발생한다.
  • 분석 시간은 총 활용도와 거의 무관하며, BF 기반 방법이 더 단순한 비교 논리 덕분에 SMS 기반 방법보다 빠르다.
  • 이 방법은 높은 확장성과 강건성을 보이며, 고자원 경쟁 조건에서도 높은 스케줄러블리티를 유지하여 실시간 GPU 워크로드에 효과적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.