Skip to main content
QUICK REVIEW

[논문 리뷰] Reducing overheads of dynamic scheduling on heterogeneous chips

Francisco Corbera, Andrés Rodríguez|arXiv (Cornell University)|2015. 01. 14.
Parallel Computing and Optimization Techniques참고 문헌 14인용 수 4
한 줄 요약

이 논문은 통합된 CPU와 GPU를 갖춘 이종 칩에서 비정규적 워크로드(예: Barnes Hut)에 대해 오버헤드를 줄이기 위해 동적 스케줄링 최적화를 제안한다. 호스트 스레드 우선순위를 높이고 운영체제별 스케줄링 행동을 고려함으로써, 인텔 허슬과 샤오미 엑시노스 비트.리틀에서 각각 에너지-지연 제품(EDP)을 최대 84%와 57% 감소시켜 동적 오프로딩 환경에서 성능과 에너지 효율성을 크게 향상시킨다.

ABSTRACT

In recent processor development, we have witnessed the integration of GPU and CPUs into a single chip. The result of this integration is a reduction of the data communication overheads. This enables an efficient collaboration of both devices in the execution of parallel workloads. In this work, we focus on the problem of efficiently scheduling chunks of iterations of parallel loops among the computing devices on the chip (the GPU and the CPU cores) in the context of irregular applications. In particular, we analyze the sources of overhead that the host thread experiments when a chunk of iterations is offloaded to the GPU while other threads are executing concurrently other chunks on the CPU cores. We carefully study these overheads on different processor architectures and operating systems using Barnes Hut as a study case representative of irregular applications. We also propose a set of optimizations to mitigate the overheads that arise in presence of oversubscription and take advantage of the different features of the heterogeneous architectures. Thanks to these optimizations we reduce Energy-Delay Product (EDP) by 18% and 84% on Intel Ivy Bridge and Haswell architectures, respectively, and by 57% on the Exynos big.LITTLE.

연구 동기 및 목표

  • 통합 GPU를 갖춘 이종 칩에서 비정규적 응용 프로그램의 동적 스케줄링에서 성능 저하 문제를 해결한다.
  • GPU에 반복 작업의 조각을 오프로드할 때 주로 발생하는 호스트 스레드 재스케줄링 오버헤드를 포함한 핵심 오버헤드 원인을 규명하고 이를 완화한다.
  • 과도하게 할당된 환경에서 CPU 코어와 GPU 간의 로드 밸런싱 및 자원 활용도를 향상시킨다.
  • 다양한 아키텍처(인텔 아이비 브리지, 허슬, 엑시노스 비트.리틀)와 운영체제(윈도우, 리눅스)에서 스케줄링 최적화의 영향을 평가한다.
  • 대상 스레드 스케줄링과 우선순위 조정을 통해 실행 시간을 유지하거나 향상시키면서 에너지-지연 제품(EDP)을 최소화한다.

제안 방법

  • 인텔 VTune를 사용하여 허슬 플랫폼에서 다양한 GPU 조각 크기에서 GPU 하드웨어 메트릭(EU 활동, 대기, 정지 사이클, L3 캐시 미스)과 실질적 처리량을 분석한다.
  • 통합 GPU 플랫폼에서 동적 스케줄링 시 커널 실행, 데이터 전송, 호스트 스레드 디스패칭에서 발생하는 오버헤드를 측정하고 고립한다.
  • 특히 과도하게 할당된 구성에서 호스트 스레드 재스케줄링 오버헤드를 줄이기 위해 호스트 스레드 우선순위를 높인다. 특히 윈도우 환경에서 적용한다.
  • 엑시노스 비트.리틀 아키텍처에서 저전력 A7 코어에 스레드를 고정함으로써 에너지 소비를 줄이면서도 성능을 유지한다.
  • 다양한 구성과 워크로드에서 우선순위 부여와 코어 고정의 병합 효과를 평가하여 EDP 감소 효과를 분석한다.
  • 성능과 에너지 간의 트레이드오���을 평가하기 위해 비정규적 응용 프로그램의 대표 사례로 Barnes Hut 벤치마크를 사용한다.

실험 결과

연구 질문

  • RQ1통합 GPU를 갖춘 이종 칩에서 비정규적 응용 프로그램의 동적 스케줄링에서 지배적인 오버헤드 원인은 무엇인가?
  • RQ2운영체제(윈도우 대비 리눅스)가 과도하게 할당된 상황에서 호스트 스레드 재스케줄링 오버헤드에 미치는 영향은 어떻게 달라지는가?
  • RQ3윈도우 환경에서 인텔 플랫폼에서 호스트 스레드 우선순위를 높이면 실행 시간과 에너지 소비는 얼마나 감소하는가?
  • RQ4엑시노스 비트.리틀 아키텍처에서 호스트 스레드를 저전력 A7 코어에 고정함으로써 얻는 에너지 및 성능 이점은 무엇인가?
  • RQ5Barnes Hut과 같은 비정규적 워크로드에서 GPU 오프로드 조각의 크기는 GPU 성능과 전체 EDP에 어떤 영향을 미치는가?

주요 결과

  • 윈도우 환경에서 인텔 허슬 플랫폼에서 호스트 스레드 우선순위를 높이면 기준 동적 스케줄링 대비 에너지-지연 제품(EDP)이 84% 감소한다.
  • 윈도우 환경에서 인텔 아이비 브리지 플랫폼에서 호스트 스레드 우선순위 부여로 EDP가 18% 감소하여 과도하게 할당된 환경에서 뚜렷한 성능 향상을 보였다.
  • 리눅스 환경에서 엑시노스 5 비트.리틀 플랫폼에서 호스트 스레드를 A7 코어에 고정하면 표준 동적 스케줄링 대비 EDP가 46% 감소한다.
  • 엑시노스 플랫폼에서 호스트 스레드 우선순위 부여와 A7 코어 고정을 병행하면 추가로 7.8%의 EDP 감소 효과를 얻어 총 EDP 감소율이 57%에 이른다.
  • 엑시노스 플랫폼의 리눅스 스케줄러는 우선순위 조정 없이도 과도할당을 효과적으로 관리하므로 스레드 고정이 주요 최적화 수단이 된다.
  • 자원이 과도하게 할당되지 않은 비과도할당 구성(예: 3+1)에서는 호스트 스레드 우선순위 증가가 거의 효과가 없음을 확인하여 오버헤드가 자원 활용도가 낮을 때는 덜 중요하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.